Unindo VideoQA e Tarefas Agentivas Guiadas por Vídeo por meio de Extração Generalizada de Quadros-chave
Bridging VideoQA and Video-Guided Agentic Tasks via Generalized Keyframe Extraction
June 28, 2026
Autores: Sunqi Fan, Qingle Liu, Runqi Yin, Meng-Hao Guo, Shuojin Yang
cs.AI
Resumo
A compreensão de vídeo é uma capacidade fundamental para a inteligência multimodal, e os recentes Modelos de Linguagem Grande Multimodais (MLLMs) alcançaram um desempenho notável em benchmarks de Resposta a Perguntas sobre Vídeo (VideoQA). No entanto, os benchmarks existentes avaliam principalmente se os modelos podem perceber pistas visuais superficiais, raramente examinando se os MLLMs podem aprender conhecimentos mais profundos ou habilidades processuais a partir de tutoriais em vídeo e generalizá-los para tarefas agênticas de longo horizonte downstream. Para preencher essa lacuna, apresentamos o VG-GUIBench (Benchmark de GUI Guiado por Vídeo), um novo benchmark projetado para avaliar se agentes GUI baseados em MLLMs podem seguir tutoriais em vídeo para concluir tarefas interativas de GUI correspondentes. Além disso, observamos que o desempenho dos modelos tanto em VideoQA quanto em tarefas agênticas guiadas por vídeo depende criticamente da extração eficaz de quadros-chave. Com base nessa observação, propomos o TASKER (Pesquisador de Quadros-Chave Orientado por Tarefa e Ciente de Cena), um algoritmo de extração de quadros-chave que considera conjuntamente a relevância da tarefa e a dinâmica da cena para identificar quadros informativos. Resultados experimentais demonstram que o TASKER alcança melhorias significativas de desempenho tanto em VideoQA quanto em benchmarks de tarefas agênticas guiadas por vídeo, superando a melhor linha de base em 2,0% no conjunto completo do EgoSchema e 1,8% no conjunto de dados NExT-QA, respectivamente. Esses resultados destacam ainda mais o potencial de métodos generalizados de extração de quadros-chave para tarefas de compreensão de vídeo. Nosso código e dados estão disponíveis em https://github.com/VG-GUI-TASKER/VG-GUI-TASKER.
English
Video understanding is a fundamental capability for multimodal intelligence, and recent Multimodal Large Language Models (MLLMs) have achieved remarkable performance on Video Question Answering (VideoQA) benchmarks. However, existing benchmarks primarily evaluate whether models can perceive shallow visual cues, while rarely examining whether MLLMs can learn deeper knowledge or procedural skills from video tutorials and generalize them to downstream long-horizon agentic tasks. To address this gap, we introduce VG-GUIBench (Video-Guided GUI Benchmark), a new benchmark designed to evaluate whether MLLM-based GUI agents can follow video tutorials to complete corresponding GUI interactive tasks. Furthermore, we observe that the performance of models on both VideoQA and video-guided agentic tasks critically depends on effective keyframe extraction. Based on this observation, we propose TASKER (Task-driven And Scene-aware Keyframe searchER), a keyframe extraction algorithm that jointly considers task relevance and scene dynamics to identify informative frames. Experimental results demonstrate that TASKER achieves significant performance improvements on both VideoQA and video-guided agentic task benchmarks, outperforming the best baseline by 2.0% on the EgoSchema fullset and 1.8% on the NExT-QA dataset, respectively. These results further highlight the potential of generalized keyframe extraction methods for video understanding tasks. Our code and data are available at https://github.com/VG-GUI-TASKER/VG-GUI-TASKER.