ChatPaper.aiChatPaper

Respuesta a Preguntas sobre Videos con Respaldo de Evidencia

Evidence-Backed Video Question Answering

July 13, 2026
Autores: Shijie Wang, Honglu Zhou, Ziyang Wang, Ran Xu, Caiming Xiong, Silvio Savarese, Chen Sun, Juan Carlos Niebles
cs.AI

Resumen

Los modelos de lenguaje de gran escala para video (Video LLMs) actuales destacan en la respuesta a preguntas (QA), pero funcionan en gran medida como cajas negras, proporcionando respuestas textuales sin una fundamentación visual verificable. Los esfuerzos existentes en explicabilidad se basan en justificaciones textuales o cuadros delimitadores dispersos, que tienen dificultades para capturar dinámicas de video complejas como oclusiones y deformaciones no rígidas. Proponemos la Respuesta a Preguntas de Video Respaldada por Evidencia (E-VQA), una nueva tarea que exige que los modelos generen conjuntamente una respuesta semántica y evidencia espacio-temporal precisa: segmentos temporales y máscaras de segmentación de objetos densas y con seguimiento (masklets). Para respaldar esto, presentamos ST-Evidence, el primer punto de referencia verificado por humanos para la fundamentación a nivel de píxel tanto discriminativa como generativa. Las evaluaciones de modelos de última generación revelan un desacoplamiento crítico entre la precisión de QA y la percepción visual real, que el escalamiento por sí solo no logra cerrar. Para abordar esto, desarrollamos pipelines de generación automatizada y escalable para crear ST-Evidence-Instruct, un conjunto de datos a escala de 160k que une el razonamiento de alto nivel con la fundamentación de grano fino. El ajuste fino de Video LLMs fundamentados con estos datos produce ganancias sustanciales sobre las líneas base UniPixel de tamaño equivalente correspondientes (por ejemplo, +27.2 t-mean y +13.8 J&F en un modelo de 7B), estableciendo una base sólida para la comprensión de video explicable y respaldada por evidencia. El código y los datos están disponibles en https://github.com/SalesforceAIResearch/EVQA.
English
Current Video Large Language Models (Video LLMs) excel in question answering (QA) but largely operate as black boxes, providing textual answers without verifiable visual grounding. Existing explainability efforts rely on textual rationales or sparse bounding boxes, which struggle to capture complex video dynamics such as occlusions and non-rigid deformations. We propose Evidence-Backed Video Question Answering (E-VQA), a novel task requiring models to jointly output a semantic answer and precise spatio-temporal evidence: temporal segments and dense, tracked object segmentation masklets. To support this, we introduce ST-Evidence, the first human-verified benchmark for both discriminative and generative pixel-level grounding. Evaluations of state-of-the-art models reveal a critical decoupling between QA accuracy and true visual perception that scaling alone fails to bridge. To address this, we develop scalable, automated generation pipelines to create ST-Evidence-Instruct, a 160k-scale dataset bridging high-level reasoning with fine-grained grounding. Fine-tuning grounded Video LLMs on this data yields substantial gains over the corresponding size-matched UniPixel baselines (e.g., +27.2 t-mean and +13.8 J&F on a 7B model), establishing a robust baseline for explainable, evidence-backed video understanding. Code and data are available at https://github.com/SalesforceAIResearch/EVQA.