Resposta a Perguntas de Vídeo Baseada em Evidências
Evidence-Backed Video Question Answering
July 13, 2026
Autores: Shijie Wang, Honglu Zhou, Ziyang Wang, Ran Xu, Caiming Xiong, Silvio Savarese, Chen Sun, Juan Carlos Niebles
cs.AI
Resumo
Os atuais Modelos de Linguagem de Grande Escala para Vídeo (Video LLMs) destacam-se em resposta a perguntas (QA), mas operam em grande parte como caixas pretas, fornecendo respostas textuais sem fundamentação visual verificável. Esforços existentes de explicabilidade dependem de justificativas textuais ou caixas delimitadoras esparsas, que têm dificuldade em capturar dinâmicas complexas de vídeo, como oclusões e deformações não rígidas. Propomos o Evidence-Backed Video Question Answering (E-VQA), uma nova tarefa que exige que os modelos gerem conjuntamente uma resposta semântica e evidências espaço-temporais precisas: segmentos temporais e máscaras de segmentação de objetos densas e rastreadas (masklets). Para apoiar isso, introduzimos o ST-Evidence, o primeiro benchmark verificado por humanos para fundamentação discriminativa e generativa em nível de pixel. Avaliações de modelos de última geração revelam uma dissociação crítica entre a precisão do QA e a verdadeira percepção visual, que a escala por si só não consegue superar. Para resolver isso, desenvolvemos pipelines de geração automatizados e escaláveis para criar o ST-Evidence-Instruct, um conjunto de dados de 160 mil amostras que une raciocínio de alto nível com fundamentação refinada. O ajuste fino de Video LLMs fundamentados nesses dados produz ganhos substanciais em relação às linhas de base UniPixel de tamanho correspondente (por exemplo, +27,2 t-mean e +13,8 J&F em um modelo de 7B), estabelecendo uma linha de base robusta para compreensão de vídeo explicável e baseada em evidências. Código e dados estão disponíveis em https://github.com/SalesforceAIResearch/EVQA.
English
Current Video Large Language Models (Video LLMs) excel in question answering (QA) but largely operate as black boxes, providing textual answers without verifiable visual grounding. Existing explainability efforts rely on textual rationales or sparse bounding boxes, which struggle to capture complex video dynamics such as occlusions and non-rigid deformations. We propose Evidence-Backed Video Question Answering (E-VQA), a novel task requiring models to jointly output a semantic answer and precise spatio-temporal evidence: temporal segments and dense, tracked object segmentation masklets. To support this, we introduce ST-Evidence, the first human-verified benchmark for both discriminative and generative pixel-level grounding. Evaluations of state-of-the-art models reveal a critical decoupling between QA accuracy and true visual perception that scaling alone fails to bridge. To address this, we develop scalable, automated generation pipelines to create ST-Evidence-Instruct, a 160k-scale dataset bridging high-level reasoning with fine-grained grounding. Fine-tuning grounded Video LLMs on this data yields substantial gains over the corresponding size-matched UniPixel baselines (e.g., +27.2 t-mean and +13.8 J&F on a 7B model), establishing a robust baseline for explainable, evidence-backed video understanding. Code and data are available at https://github.com/SalesforceAIResearch/EVQA.