ChatPaper.aiChatPaper

Decodificación autoregresiva paralelizada para descripción densa de video omni-modal

Parallelized Autoregressive Decoding for Omni-Modal Dense Video Captioning

July 3, 2026
Autores: Wenzheng Zeng, Siyi Jiao, Chen Gao, Hwee Tou Ng, Mike Zheng Shou
cs.AI

Resumen

El subtitulado denso de video tiene como objetivo generar descripciones temporalmente fundamentadas de eventos de video, beneficiando tanto la comprensión como la generación de video a nivel de eventos. En este dominio, los modelos de lenguaje grandes de video autorregresivos han surgido como un paradigma prevalente debido a su fuerte capacidad generativa y de modelado cross-modal. Sin embargo, generar subtítulos densos bajo el paradigma token por token limita severamente la eficiencia de inferencia y dificulta la escalabilidad a medida que aumentan la duración del video y la densidad de eventos. En este trabajo, proponemos un marco autorregresivo paralelizado que no solo mejora la eficiencia de generación sino que también realza el rendimiento del subtitulado temporalmente fundamentado. Nuestra idea clave es explotar las débiles dependencias locales entre eventos temporalmente distintos para reestructurar el grafo de dependencia causal, permitiendo así una generación paralela sin pérdidas. Específicamente, los tokens con débiles dependencias entre eventos pueden decodificarse en paralelo, mientras que los tokens fuertemente acoplados dentro de cada evento retienen la decodificación secuencial para preservar la coherencia semántica local. Para materializar esta idea, introducimos dos componentes clave para la decodificación paralela sin pérdidas: (1) un mecanismo de planificación global latente que aprende automáticamente la estructura a nivel de eventos y produce tokens compactos que codifican la causalidad global entre eventos, mientras agrega adaptativamente semántica audiovisual a nivel de eventos, guiando la posterior reestructuración de dependencias y la decodificación paralela; y (2) un mecanismo de decodificación paralela factorizada por eventos que equilibra efectivamente el enfoque local con la conciencia global entre eventos. Los experimentos en varios puntos de referencia demuestran la clara ventaja de nuestro enfoque tanto en eficiencia como en rendimiento en el anclaje y subtitulado de eventos omni-modales. Sitio web del proyecto: https://github.com/showlab/PadCaptioner.
English
Dense video captioning aims to generate temporally grounded descriptions of video events, benefiting both event-level video understanding and generation. In this domain, autoregressive video large language models have emerged as a prevalent paradigm due to their strong generative and cross-modal modeling capacity. However, generating dense captions under the token-by-token paradigm severely limits inference efficiency and hinders scalability as video length and event density increase. In this work, we propose a parallelized autoregressive framework that not only improves generation efficiency but also enhances temporally grounded captioning performance. Our key insight is to exploit the weak local dependencies across temporally distinct events to restructure the causal dependency graph, thereby enabling lossless parallel generation. Specifically, tokens with weak cross-event dependencies can be decoded in parallel, while tightly coupled tokens within each event retain sequential decoding to preserve local semantic coherence. To realize this insight, we introduce two key components for lossless parallel decoding: (1) a latent global planning mechanism that automatically learns the event-level structure and produces compact tokens encoding global inter-event causality while adaptively aggregating event-level audio-visual semantics, guiding subsequent dependency restructuring and parallel decoding; and (2) an event-factorized parallel decoding mechanism that effectively balances local focus with global inter-event awareness. Experiments on various benchmarks demonstrate the clear advantage of our approach in both efficiency and performance in omni-modal event grounding and captioning. Project website: https://github.com/showlab/PadCaptioner.