ChatPaper.aiChatPaper

Question-réponse vidéo étayée par des preuves

Evidence-Backed Video Question Answering

July 13, 2026
Auteurs: Shijie Wang, Honglu Zhou, Ziyang Wang, Ran Xu, Caiming Xiong, Silvio Savarese, Chen Sun, Juan Carlos Niebles
cs.AI

Résumé

Les grands modèles de langage vidéo (Video LLM) actuels excellent dans la réponse aux questions (QA), mais fonctionnent en grande partie comme des boîtes noires, fournissant des réponses textuelles sans ancrage visuel vérifiable. Les efforts d'explicabilité existants reposent sur des justifications textuelles ou des boîtes englobantes clairsemées, qui peinent à capturer les dynamiques vidéo complexes telles que les occlusions et les déformations non rigides. Nous proposons la Réponse aux Questions Vidéo Étayée par des Preuves (E-VQA), une nouvelle tâche qui exige des modèles qu'ils produisent conjointement une réponse sémantique et des preuves spatio-temporelles précises : des segments temporels et des masques de segmentation denses et suivis par objet (masklets). Pour soutenir cette tâche, nous introduisons ST-Evidence, le premier benchmark vérifié par des humains pour un ancrage au niveau pixel à la fois discriminatif et génératif. Les évaluations des modèles de pointe révèlent un découplage critique entre la précision en QA et la perception visuelle réelle, que le simple passage à l'échelle ne parvient pas à combler. Pour y remédier, nous développons des pipelines de génération automatisés et évolutifs afin de créer ST-Evidence-Instruct, un jeu de données à l'échelle de 160k qui relie le raisonnement de haut niveau à un ancrage fin. L'affinage de Video LLM ancrés sur ces données produit des gains substantiels par rapport aux modèles de base UnPixel de taille équivalente (par exemple, +27,2 en t-mean et +13,8 en J&F sur un modèle 7B), établissant une base de référence robuste pour une compréhension vidéo explicable et étayée par des preuves. Le code et les données sont disponibles à l’adresse https://github.com/SalesforceAIResearch/EVQA.
English
Current Video Large Language Models (Video LLMs) excel in question answering (QA) but largely operate as black boxes, providing textual answers without verifiable visual grounding. Existing explainability efforts rely on textual rationales or sparse bounding boxes, which struggle to capture complex video dynamics such as occlusions and non-rigid deformations. We propose Evidence-Backed Video Question Answering (E-VQA), a novel task requiring models to jointly output a semantic answer and precise spatio-temporal evidence: temporal segments and dense, tracked object segmentation masklets. To support this, we introduce ST-Evidence, the first human-verified benchmark for both discriminative and generative pixel-level grounding. Evaluations of state-of-the-art models reveal a critical decoupling between QA accuracy and true visual perception that scaling alone fails to bridge. To address this, we develop scalable, automated generation pipelines to create ST-Evidence-Instruct, a 160k-scale dataset bridging high-level reasoning with fine-grained grounding. Fine-tuning grounded Video LLMs on this data yields substantial gains over the corresponding size-matched UniPixel baselines (e.g., +27.2 t-mean and +13.8 J&F on a 7B model), establishing a robust baseline for explainable, evidence-backed video understanding. Code and data are available at https://github.com/SalesforceAIResearch/EVQA.