ChatPaper.aiChatPaper

Geparalleliseerde autoregressieve decodering voor omni-modale dichte videobeschrijving

Parallelized Autoregressive Decoding for Omni-Modal Dense Video Captioning

July 3, 2026
Auteurs: Wenzheng Zeng, Siyi Jiao, Chen Gao, Hwee Tou Ng, Mike Zheng Shou
cs.AI

Samenvatting

Dichte videobijschriftgeneratie heeft als doel om tijdelijk gefundeerde beschrijvingen van video-evenementen te genereren, wat zowel gebeurtenisniveau videobegrip als -generatie ten goede komt. In dit domein zijn autoregressieve video-grote taalmodellen naar voren gekomen als een prevalent paradigma vanwege hun sterke generatieve en cross-modale modelleringcapaciteit. Het genereren van dichte bijschriften onder het token-voor-token paradigma beperkt echter de inferentie-efficiëntie aanzienlijk en belemmert de schaalbaarheid naarmate de videolengte en gebeurtenisdichtheid toenemen. In dit werk stellen we een geparalleliseerd autoregressief raamwerk voor dat niet alleen de generatie-efficiëntie verbetert, maar ook de tijdelijk gefundeerde bijschriftprestaties versterkt. Ons belangrijkste inzicht is het benutten van de zwakke lokale afhankelijkheden tussen temporeel verschillende gebeurtenissen om de causale afhankelijkheidsgraaf te herstructureren, waardoor verliesloze parallelle generatie mogelijk wordt. Specifiek kunnen tokens met zwakke cross-evenementafhankelijkheden parallel worden gedecodeerd, terwijl sterk gekoppelde tokens binnen elke gebeurtenis sequentieel decoderen behouden om de lokale semantische coherentie te waarborgen. Om dit inzicht te realiseren introduceren we twee kerncomponenten voor verliesloze parallelle decodering: (1) een latent globaal planningsmechanisme dat automatisch de gebeurtenisniveau-structuur leert en compacte tokens produceert die de globale inter-gebeurteniscausaliteit coderen, terwijl het adaptief gebeurtenisniveau audio-visuele semantiek aggregeert, wat de daaropvolgende afhankelijkheidsherstructurering en parallelle decodering begeleidt; en (2) een gebeurtenis-gefactoriseerd parallel decodermechanisme dat effectief lokale focus met globaal inter-gebeurtenisbewustzijn in evenwicht brengt. Experimenten op verschillende benchmarks tonen het duidelijke voordeel van onze aanpak in zowel efficiëntie als prestatie in omni-modale gebeurtenisgronding en bijschriftgeneratie. Projectwebsite: https://github.com/showlab/PadCaptioner.
English
Dense video captioning aims to generate temporally grounded descriptions of video events, benefiting both event-level video understanding and generation. In this domain, autoregressive video large language models have emerged as a prevalent paradigm due to their strong generative and cross-modal modeling capacity. However, generating dense captions under the token-by-token paradigm severely limits inference efficiency and hinders scalability as video length and event density increase. In this work, we propose a parallelized autoregressive framework that not only improves generation efficiency but also enhances temporally grounded captioning performance. Our key insight is to exploit the weak local dependencies across temporally distinct events to restructure the causal dependency graph, thereby enabling lossless parallel generation. Specifically, tokens with weak cross-event dependencies can be decoded in parallel, while tightly coupled tokens within each event retain sequential decoding to preserve local semantic coherence. To realize this insight, we introduce two key components for lossless parallel decoding: (1) a latent global planning mechanism that automatically learns the event-level structure and produces compact tokens encoding global inter-event causality while adaptively aggregating event-level audio-visual semantics, guiding subsequent dependency restructuring and parallel decoding; and (2) an event-factorized parallel decoding mechanism that effectively balances local focus with global inter-event awareness. Experiments on various benchmarks demonstrate the clear advantage of our approach in both efficiency and performance in omni-modal event grounding and captioning. Project website: https://github.com/showlab/PadCaptioner.