ChatPaper.aiChatPaper

CollabVR: Collaboratieve videoredenering met visie-taal- en videogeneratiemodellen

CollabVR: Collaborative Video Reasoning with Vision-Language and Video Generation Models

May 9, 2026
Auteurs: Joowon Kim, Seungho Shin, Joonhyung Park, Eunho Yang
cs.AI

Samenvatting

Recente 'Thinking with Video'-benaderingen maken gebruik van Videogeneratiemodellen (VGM's) voor visueel redeneren door temporeel coherente ketens van frames te produceren als redeneerartefacten. Zelfs sterke VGM's vertonen echter twee terugkerende faalwijzen bij doelgerichte taken: drift over lange termijn bij meerstapstaken en cumulatieve simulatie-errors halverwege clips. Beide komen voort uit het ontbreken van expliciet redeneren dat is gebaseerd op de korte-termijn visuele voorkennis van de VGM, een rol die van nature wordt vervuld door Visueel-Taalkundige Modellen (VLM's). Maar waar de VLM te plaatsen is niet triviaal: voorafgaande plannen verbinden voordat enig frame is gegenereerd, en nabeschouwingen over hele video's grijpen te laat in. Wij stellen VLM-VGM Collaboratief Video Redeneren (CollabVR) voor, een gesloten-lus raamwerk dat de VLM koppelt aan de VGM op stapsgewijze granulariteit: de VLM plant de direct volgende actie, inspecteert de clip die de VGM genereert, en integreert de diagnose van de verificateur rechtstreeks in de volgende actieprompt om gedetecteerde fouten te herstellen. Op Gen-ViRe en VBVR-Bench verbetert CollabVR zowel open-source als closed-source VGM's ten opzichte van enkelvoudige inferentie, Pass@k, en eerdere test-time scaling-baselines bij gelijke rekenkracht, met de grootste winst op de moeilijkste taken. Het levert ook verdere verbeteringen op bovenop een voor redeneren fijn afgestelde VGM, wat aangeeft dat stapsgewijze VLM-supervisie orthogonaal is aan en stapelbaar met redeneringsgerichte fijnafstemming. We bieden videovoorbeelden en aanvullende kwalitatieve resultaten op onze projectpagina: https://joow0n-kim.github.io/collabvr-project-page.
English
Recent "Thinking with Video" approaches use Video Generation Models (VGMs) for visual reasoning by producing temporally coherent Chain-of-Frames as reasoning artifacts. Even strong VGMs, however, exhibit two recurring failure modes on goal-directed tasks: long-horizon drift on multi-step tasks and mid-clip simulation errors that compound. Both stem from the absence of explicit reasoning built upon the VGM's short-horizon visual prior, a role naturally filled by Vision-Language Models (VLMs), but where to place the VLM is non-trivial: upfront plans commit before any frame is generated and post-hoc critiques over whole videos intervene too late. We propose VLM-VGM Collaborative Video Reasoning (CollabVR), a closed-loop framework that couples the VLM with the VGM at step-level granularity: the VLM plans the immediate next action, inspects the clip the VGM generates, and folds the verifier's diagnosis directly into the next action prompt to repair detected failures. On Gen-ViRe and VBVR-Bench, CollabVR improves both open-source and closed-source VGMs over single-inference, Pass@k, and prior test-time scaling baselines at matched compute, with the largest gains on the hardest tasks. It also yields further improvements on top of a reasoning-fine-tuned VGM, indicating that step-level VLM supervision is orthogonal to and stackable with reasoning-oriented fine-tuning. We provide video samples and additional qualitative results at our project page: https://joow0n-kim.github.io/collabvr-project-page.