Décodage autorégressif parallélisé pour la description dense de vidéos omni-modales
Parallelized Autoregressive Decoding for Omni-Modal Dense Video Captioning
July 3, 2026
Auteurs: Wenzheng Zeng, Siyi Jiao, Chen Gao, Hwee Tou Ng, Mike Zheng Shou
cs.AI
Résumé
Le sous-titrage vidéo dense vise à générer des descriptions temporellement ancrées des événements vidéo, bénéficiant à la fois à la compréhension et à la génération d'événements au niveau vidéo. Dans ce domaine, les modèles de langage vidéo autorégressifs à grande échelle sont devenus un paradigme dominant en raison de leur forte capacité générative et de modélisation intermodale. Cependant, générer des légendes denses selon le paradigme token par token limite sévèrement l'efficacité de l'inférence et entrave l'évolutivité à mesure que la longueur de la vidéo et la densité des événements augmentent. Dans ce travail, nous proposons un cadre autorégressif parallélisé qui améliore non seulement l'efficacité de la génération, mais aussi les performances de sous-titrage temporellement ancré. Notre idée clé consiste à exploiter les faibles dépendances locales entre des événements temporellement distincts pour restructurer le graphe de dépendance causale, permettant ainsi une génération parallèle sans perte. Plus précisément, les tokens présentant de faibles dépendances inter-événements peuvent être décodés en parallèle, tandis que les tokens fortement couplés au sein de chaque événement conservent un décodage séquentiel pour préserver la cohérence sémantique locale. Pour concrétiser cette idée, nous introduisons deux composants clés pour un décodage parallèle sans perte : (1) un mécanisme de planification globale latente qui apprend automatiquement la structure au niveau des événements et produit des tokens compacts encodant la causalité inter-événements globale tout en agrégeant de manière adaptative la sémantique audio-visuelle au niveau des événements, guidant ainsi la restructuration des dépendances et le décodage parallèle ultérieurs ; et (2) un mécanisme de décodage parallèle factorisé par événement qui équilibre efficacement l'attention locale et la conscience inter-événements globale. Des expériences sur divers bancs d'essai démontrent l'avantage manifeste de notre approche en termes d'efficacité et de performance dans l'ancrage et le sous-titrage d'événements omni-modaux. Site web du projet : https://github.com/showlab/PadCaptioner.
English
Dense video captioning aims to generate temporally grounded descriptions of video events, benefiting both event-level video understanding and generation. In this domain, autoregressive video large language models have emerged as a prevalent paradigm due to their strong generative and cross-modal modeling capacity. However, generating dense captions under the token-by-token paradigm severely limits inference efficiency and hinders scalability as video length and event density increase. In this work, we propose a parallelized autoregressive framework that not only improves generation efficiency but also enhances temporally grounded captioning performance. Our key insight is to exploit the weak local dependencies across temporally distinct events to restructure the causal dependency graph, thereby enabling lossless parallel generation. Specifically, tokens with weak cross-event dependencies can be decoded in parallel, while tightly coupled tokens within each event retain sequential decoding to preserve local semantic coherence. To realize this insight, we introduce two key components for lossless parallel decoding: (1) a latent global planning mechanism that automatically learns the event-level structure and produces compact tokens encoding global inter-event causality while adaptively aggregating event-level audio-visual semantics, guiding subsequent dependency restructuring and parallel decoding; and (2) an event-factorized parallel decoding mechanism that effectively balances local focus with global inter-event awareness. Experiments on various benchmarks demonstrate the clear advantage of our approach in both efficiency and performance in omni-modal event grounding and captioning. Project website: https://github.com/showlab/PadCaptioner.