Decodificação Autoregressiva Paralelizada para Legendagem Densa de Vídeo Omni-Modal
Parallelized Autoregressive Decoding for Omni-Modal Dense Video Captioning
July 3, 2026
Autores: Wenzheng Zeng, Siyi Jiao, Chen Gao, Hwee Tou Ng, Mike Zheng Shou
cs.AI
Resumo
A descrição densa de vídeos visa gerar descrições temporalmente ancoradas de eventos de vídeo, beneficiando tanto a compreensão quanto a geração de vídeos em nível de evento. Neste domínio, grandes modelos de linguagem auto-regressivos para vídeos emergiram como um paradigma prevalente devido à sua forte capacidade generativa e de modelagem cross-modal. No entanto, gerar descrições densas sob o paradigma token por token limita severamente a eficiência da inferência e dificulta a escalabilidade à medida que a duração do vídeo e a densidade de eventos aumentam. Neste trabalho, propomos uma estrutura auto-regressiva paralelizada que não apenas melhora a eficiência da geração, mas também aprimora o desempenho da descrição temporalmente ancorada. Nossa ideia chave é explorar as fracas dependências locais entre eventos temporalmente distintos para reestruturar o grafo de dependência causal, permitindo assim a geração paralela sem perdas. Especificamente, tokens com fracas dependências entre eventos podem ser decodificados em paralelo, enquanto tokens fortemente acoplados dentro de cada evento mantêm a decodificação sequencial para preservar a coerência semântica local. Para concretizar essa ideia, introduzimos dois componentes chave para decodificação paralela sem perdas: (1) um mecanismo de planejamento global latente que aprende automaticamente a estrutura em nível de evento e produz tokens compactos codificando causalidade global entre eventos, enquanto agrega adaptativamente a semântica audiovisual em nível de evento, orientando a subsequente reestruturação de dependências e decodificação paralela; e (2) um mecanismo de decodificação paralela fatorada por evento que equilibra eficazmente o foco local com a consciência global entre eventos. Experimentos em diversos benchmarks demonstram a clara vantagem de nossa abordagem tanto em eficiência quanto em desempenho na ancoragem e descrição de eventos oni-modais. Site do projeto: https://github.com/showlab/PadCaptioner.
English
Dense video captioning aims to generate temporally grounded descriptions of video events, benefiting both event-level video understanding and generation. In this domain, autoregressive video large language models have emerged as a prevalent paradigm due to their strong generative and cross-modal modeling capacity. However, generating dense captions under the token-by-token paradigm severely limits inference efficiency and hinders scalability as video length and event density increase. In this work, we propose a parallelized autoregressive framework that not only improves generation efficiency but also enhances temporally grounded captioning performance. Our key insight is to exploit the weak local dependencies across temporally distinct events to restructure the causal dependency graph, thereby enabling lossless parallel generation. Specifically, tokens with weak cross-event dependencies can be decoded in parallel, while tightly coupled tokens within each event retain sequential decoding to preserve local semantic coherence. To realize this insight, we introduce two key components for lossless parallel decoding: (1) a latent global planning mechanism that automatically learns the event-level structure and produces compact tokens encoding global inter-event causality while adaptively aggregating event-level audio-visual semantics, guiding subsequent dependency restructuring and parallel decoding; and (2) an event-factorized parallel decoding mechanism that effectively balances local focus with global inter-event awareness. Experiments on various benchmarks demonstrate the clear advantage of our approach in both efficiency and performance in omni-modal event grounding and captioning. Project website: https://github.com/showlab/PadCaptioner.