Доказательное видео-вопрос-ответ
Evidence-Backed Video Question Answering
July 13, 2026
Авторы: Shijie Wang, Honglu Zhou, Ziyang Wang, Ran Xu, Caiming Xiong, Silvio Savarese, Chen Sun, Juan Carlos Niebles
cs.AI
Аннотация
Современные большие видеомодели (Video LLM) демонстрируют высокую точность в задачах вопросно-ответного взаимодействия (QA), однако в значительной степени остаются «чёрными ящиками», выдавая текстовые ответы без проверяемой визуальной привязки. Существующие подходы к объяснимости опираются на текстовые обоснования или редкие ограничивающие рамки, которые плохо справляются с захватом сложной динамики видео, такой как затенения и нежёсткие деформации. Мы предлагаем задачу Evidence-Backed Video Question Answering (E-VQA) — новый формат, требующий от моделей совместного вывода семантического ответа и точных пространственно-временных свидетельств: временных сегментов и плотных, отслеживаемых масклетов сегментации объектов. Для поддержки этой задачи мы представляем ST-Evidence — первый верифицированный человеком бенчмарк для дискриминантной и генеративной привязки на уровне пикселей. Оценка современных моделей выявляет критическое рассогласование между точностью QA и истинным визуальным восприятием, которое одно лишь масштабирование не в состоянии устранить. Для решения этой проблемы мы разрабатываем масштабируемые автоматизированные конвейеры генерации, создающие ST-Evidence-Instruct — набор данных объёмом 160 тыс. примеров, соединяющий высокоуровневое рассуждение с мелкозернистой привязкой. Тонкая настройка grounded-видеомоделей на этих данных приводит к значительному улучшению по сравнению с соответствующими базовыми моделями UnPixel (например, +27,2 t-mean и +13,8 J&F для модели 7B), устанавливая надёжный базовый уровень для объяснимого, подтверждённого свидетельствами понимания видео. Код и данные доступны по адресу https://github.com/SalesforceAIResearch/EVQA.
English
Current Video Large Language Models (Video LLMs) excel in question answering (QA) but largely operate as black boxes, providing textual answers without verifiable visual grounding. Existing explainability efforts rely on textual rationales or sparse bounding boxes, which struggle to capture complex video dynamics such as occlusions and non-rigid deformations. We propose Evidence-Backed Video Question Answering (E-VQA), a novel task requiring models to jointly output a semantic answer and precise spatio-temporal evidence: temporal segments and dense, tracked object segmentation masklets. To support this, we introduce ST-Evidence, the first human-verified benchmark for both discriminative and generative pixel-level grounding. Evaluations of state-of-the-art models reveal a critical decoupling between QA accuracy and true visual perception that scaling alone fails to bridge. To address this, we develop scalable, automated generation pipelines to create ST-Evidence-Instruct, a 160k-scale dataset bridging high-level reasoning with fine-grained grounding. Fine-tuning grounded Video LLMs on this data yields substantial gains over the corresponding size-matched UniPixel baselines (e.g., +27.2 t-mean and +13.8 J&F on a 7B model), establishing a robust baseline for explainable, evidence-backed video understanding. Code and data are available at https://github.com/SalesforceAIResearch/EVQA.