ChatPaper.aiChatPaper

Op bewijs gebaseerde videovraagbeantwoording

Evidence-Backed Video Question Answering

July 13, 2026
Auteurs: Shijie Wang, Honglu Zhou, Ziyang Wang, Ran Xu, Caiming Xiong, Silvio Savarese, Chen Sun, Juan Carlos Niebles
cs.AI

Samenvatting

Huidige Video Grote Taalmodellen (Video LLM's) blinken uit in vraagbeantwoording (QA), maar functioneren grotendeels als black boxes, waarbij ze tekstuele antwoorden geven zonder verifieerbare visuele verankering. Bestaande verklaarbaarheidsinspanningen vertrouwen op tekstuele motiveringen of schaarse begrenzingskaders, die moeite hebben met het vastleggen van complexe videodynamiek zoals occlusies en niet-rigide vervormingen. We stellen Evidence-Backed Video Question Answering (E-VQA) voor, een nieuwe taak die van modellen vereist om gezamenlijk een semantisch antwoord en precieze spatiotemporele evidentie te geven: temporele segmenten en dichte, gevolgde objectsegmentatie-masklets. Ter ondersteuning hiervan introduceren we ST-Evidence, de eerste door mensen geverifieerde benchmark voor zowel discriminatieve als generatieve pixel-niveau verankering. Evaluaties van state-of-the-art modellen onthullen een kritische ontkoppeling tussen QA-nauwkeurigheid en echte visuele perceptie, die alleen opschalen niet kan overbruggen. Om dit aan te pakken, ontwikkelen we schaalbare, geautomatiseerde generatiepijplijnen om ST-Evidence-Instruct te creëren, een dataset op 160k-schaal die hoogwaardige redenering overbrugt met fijnmazige verankering. Fijnafstemming van verankerde Video LLM's op deze data levert aanzienlijke winst op ten opzichte van de overeenkomstige grootte-gematchte UniPixel-baselines (bijv. +27,2 t-mean en +13,8 J&F op een 7B-model), waarmee een robuuste basislijn wordt gevestigd voor uitlegbare, door evidentie ondersteunde videobegrip. Code en data zijn beschikbaar op https://github.com/SalesforceAIResearch/EVQA.
English
Current Video Large Language Models (Video LLMs) excel in question answering (QA) but largely operate as black boxes, providing textual answers without verifiable visual grounding. Existing explainability efforts rely on textual rationales or sparse bounding boxes, which struggle to capture complex video dynamics such as occlusions and non-rigid deformations. We propose Evidence-Backed Video Question Answering (E-VQA), a novel task requiring models to jointly output a semantic answer and precise spatio-temporal evidence: temporal segments and dense, tracked object segmentation masklets. To support this, we introduce ST-Evidence, the first human-verified benchmark for both discriminative and generative pixel-level grounding. Evaluations of state-of-the-art models reveal a critical decoupling between QA accuracy and true visual perception that scaling alone fails to bridge. To address this, we develop scalable, automated generation pipelines to create ST-Evidence-Instruct, a 160k-scale dataset bridging high-level reasoning with fine-grained grounding. Fine-tuning grounded Video LLMs on this data yields substantial gains over the corresponding size-matched UniPixel baselines (e.g., +27.2 t-mean and +13.8 J&F on a 7B model), establishing a robust baseline for explainable, evidence-backed video understanding. Code and data are available at https://github.com/SalesforceAIResearch/EVQA.