CollabVR : Raisonnement vidéo collaboratif avec des modèles de vision-langage et de génération vidéo
CollabVR: Collaborative Video Reasoning with Vision-Language and Video Generation Models
May 9, 2026
Auteurs: Joowon Kim, Seungho Shin, Joonhyung Park, Eunho Yang
cs.AI
Résumé
Les récentes approches de type « Thinking with Video » utilisent des Modèles de Génération Vidéo (VGM) pour le raisonnement visuel en produisant des Chaînes d'Images temporellement cohérentes comme artefacts de raisonnement. Cependant, même les VGM performants présentent deux modes d'échec récurrents sur des tâches orientées vers un objectif : une dérive à long terme sur les tâches multi-étapes et des erreurs de simulation en milieu de séquence qui se cumulent. Ces deux problèmes découlent de l'absence d'un raisonnement explicite construit sur le prior visuel à court horizon du VGM, un rôle naturellement rempli par les Modèles de Langage Visuel (VLM), mais où placer le VLM n'est pas trivial : les plans préalables s'engagent avant la génération d'images, et les critiques a posteriori de vidéos entières interviennent trop tard. Nous proposons le Raisonnement Vidéo Collaboratif VLM-VGM (CollabVR), un cadre en boucle fermée qui couple le VLM avec le VGM à une granularité au niveau des étapes : le VLM planifie l'action immédiate suivante, inspecte le segment que le VGM génère, et intègre directement le diagnostic du vérificateur dans la prochaine invite d'action pour corriger les défaillances détectées. Sur Gen-ViRe et VBVR-Bench, CollabVR améliore à la fois les VGM open-source et propriétaires par rapport à l'inférence unique, à Pass@k et aux références antérieures de mise à l'échelle au moment du test, à puissance de calcul égale, avec les plus grands gains sur les tâches les plus difficiles. Il produit également des améliorations supplémentaires au-dessus d'un VGM affiné par raisonnement, indiquant que la supervision au niveau des étapes par le VLM est orthogonale à l'affinage orienté raisonnement et peut être empilée avec ce dernier. Nous fournissons des échantillons vidéo et des résultats qualitatifs supplémentaires sur notre page de projet : https://joow0n-kim.github.io/collabvr-project-page.
English
Recent "Thinking with Video" approaches use Video Generation Models (VGMs) for visual reasoning by producing temporally coherent Chain-of-Frames as reasoning artifacts. Even strong VGMs, however, exhibit two recurring failure modes on goal-directed tasks: long-horizon drift on multi-step tasks and mid-clip simulation errors that compound. Both stem from the absence of explicit reasoning built upon the VGM's short-horizon visual prior, a role naturally filled by Vision-Language Models (VLMs), but where to place the VLM is non-trivial: upfront plans commit before any frame is generated and post-hoc critiques over whole videos intervene too late. We propose VLM-VGM Collaborative Video Reasoning (CollabVR), a closed-loop framework that couples the VLM with the VGM at step-level granularity: the VLM plans the immediate next action, inspects the clip the VGM generates, and folds the verifier's diagnosis directly into the next action prompt to repair detected failures. On Gen-ViRe and VBVR-Bench, CollabVR improves both open-source and closed-source VGMs over single-inference, Pass@k, and prior test-time scaling baselines at matched compute, with the largest gains on the hardest tasks. It also yields further improvements on top of a reasoning-fine-tuned VGM, indicating that step-level VLM supervision is orthogonal to and stackable with reasoning-oriented fine-tuning. We provide video samples and additional qualitative results at our project page: https://joow0n-kim.github.io/collabvr-project-page.