ChatPaper.aiChatPaper

Распараллеленное авторегрессивное декодирование для всемодального плотного описания видео

Parallelized Autoregressive Decoding for Omni-Modal Dense Video Captioning

July 3, 2026
Авторы: Wenzheng Zeng, Siyi Jiao, Chen Gao, Hwee Tou Ng, Mike Zheng Shou
cs.AI

Аннотация

Плотное видеоаннотирование направлено на генерацию временно привязанных описаний видеособытий, что полезно как для понимания видео на уровне событий, так и для их генерации. В этой области авторегрессионные большие языковые модели для видео стали распространенной парадигмой благодаря их высокой генеративной способности и способности к кросс-модальному моделированию. Однако генерация плотных аннотаций в парадигме «токен за токеном» значительно снижает эффективность вывода и ограничивает масштабируемость по мере увеличения длины видео и плотности событий. В данной работе мы предлагаем параллелизованную авторегрессионную структуру, которая не только повышает эффективность генерации, но и улучшает производительность временно привязанного аннотирования. Ключевая идея заключается в использовании слабых локальных зависимостей между временно различными событиями для перестройки графа причинно-следственных зависимостей, что позволяет осуществлять без потерь параллельную генерацию. В частности, токены со слабыми кросс-событийными зависимостями могут декодироваться параллельно, тогда как тесно связанные токены внутри каждого события сохраняют последовательное декодирование для поддержания локальной семантической согласованности. Для реализации этой идеи мы вводим два ключевых компонента для без потерь параллельного декодирования: (1) латентный механизм глобального планирования, который автоматически изучает структуру на уровне событий и генерирует компактные токены, кодирующие глобальную причинно-следственную связь между событиями, при этом адаптивно агрегируя аудиовизуальную семантику на уровне событий, направляя последующую перестройку зависимостей и параллельное декодирование; и (2) механизм параллельного декодирования с факторизацией событий, который эффективно балансирует локальное внимание с глобальной осведомленностью о межсобытийных связях. Эксперименты на различных эталонах демонстрируют явное преимущество нашего подхода как в эффективности, так и в производительности при омнимодальном привязывании событий и аннотировании. Веб-сайт проекта: https://github.com/showlab/PadCaptioner.
English
Dense video captioning aims to generate temporally grounded descriptions of video events, benefiting both event-level video understanding and generation. In this domain, autoregressive video large language models have emerged as a prevalent paradigm due to their strong generative and cross-modal modeling capacity. However, generating dense captions under the token-by-token paradigm severely limits inference efficiency and hinders scalability as video length and event density increase. In this work, we propose a parallelized autoregressive framework that not only improves generation efficiency but also enhances temporally grounded captioning performance. Our key insight is to exploit the weak local dependencies across temporally distinct events to restructure the causal dependency graph, thereby enabling lossless parallel generation. Specifically, tokens with weak cross-event dependencies can be decoded in parallel, while tightly coupled tokens within each event retain sequential decoding to preserve local semantic coherence. To realize this insight, we introduce two key components for lossless parallel decoding: (1) a latent global planning mechanism that automatically learns the event-level structure and produces compact tokens encoding global inter-event causality while adaptively aggregating event-level audio-visual semantics, guiding subsequent dependency restructuring and parallel decoding; and (2) an event-factorized parallel decoding mechanism that effectively balances local focus with global inter-event awareness. Experiments on various benchmarks demonstrate the clear advantage of our approach in both efficiency and performance in omni-modal event grounding and captioning. Project website: https://github.com/showlab/PadCaptioner.