Het overbruggen van VideoQA en door video geleide agentische taken via gegeneraliseerde keyframe-extractie
Bridging VideoQA and Video-Guided Agentic Tasks via Generalized Keyframe Extraction
June 28, 2026
Auteurs: Sunqi Fan, Qingle Liu, Runqi Yin, Meng-Hao Guo, Shuojin Yang
cs.AI
Samenvatting
Videobegrip is een fundamentele vaardigheid voor multimodale intelligentie, en recente Multimodale Grote Taalmodellen (MLLM's) hebben opmerkelijke prestaties behaald op benchmarks voor Video Vraagbeantwoording (VideoQA). Bestaande benchmarks evalueren echter voornamelijk of modellen oppervlakkige visuele aanwijzingen kunnen waarnemen, terwijl zelden wordt onderzocht of MLLM's diepere kennis of procedurele vaardigheden kunnen leren uit video-handleidingen en deze kunnen generaliseren naar stroomafwaartse langetermijn agentische taken. Om deze leemte aan te pakken introduceren we VG-GUIBench (Video-Guided GUI Benchmark), een nieuwe benchmark die is ontworpen om te evalueren of op MLLM gebaseerde GUI-agenten video-handleidingen kunnen volgen om bijbehorende interactieve GUI-taken uit te voeren. Verder observeren we dat de prestaties van modellen op zowel VideoQA als door video geleide agentische taken in belangrijke mate afhangen van effectieve sleutelframeextractie. Op basis van deze observatie stellen we TASKER (Task-driven And Scene-aware Keyframe searchER) voor, een sleutelframeextractie-algoritme dat zowel taakrelevantie als scènedynamiek in overweging neemt om informatieve frames te identificeren. Experimentele resultaten tonen aan dat TASKER significante prestatieverbeteringen behaalt op zowel VideoQA- als door video geleide agentische taakbenchmarks, waarbij het respectievelijk met 2,0% op de volledige EgoSchema-set en 1,8% op de NExT-QA-dataset beter presteert dan de beste basislijn. Deze resultaten benadrukken verder het potentieel van algemene sleutelframeextractiemethoden voor videobegriptaken. Onze code en data zijn beschikbaar op https://github.com/VG-GUI-TASKER/VG-GUI-TASKER.
English
Video understanding is a fundamental capability for multimodal intelligence, and recent Multimodal Large Language Models (MLLMs) have achieved remarkable performance on Video Question Answering (VideoQA) benchmarks. However, existing benchmarks primarily evaluate whether models can perceive shallow visual cues, while rarely examining whether MLLMs can learn deeper knowledge or procedural skills from video tutorials and generalize them to downstream long-horizon agentic tasks. To address this gap, we introduce VG-GUIBench (Video-Guided GUI Benchmark), a new benchmark designed to evaluate whether MLLM-based GUI agents can follow video tutorials to complete corresponding GUI interactive tasks. Furthermore, we observe that the performance of models on both VideoQA and video-guided agentic tasks critically depends on effective keyframe extraction. Based on this observation, we propose TASKER (Task-driven And Scene-aware Keyframe searchER), a keyframe extraction algorithm that jointly considers task relevance and scene dynamics to identify informative frames. Experimental results demonstrate that TASKER achieves significant performance improvements on both VideoQA and video-guided agentic task benchmarks, outperforming the best baseline by 2.0% on the EgoSchema fullset and 1.8% on the NExT-QA dataset, respectively. These results further highlight the potential of generalized keyframe extraction methods for video understanding tasks. Our code and data are available at https://github.com/VG-GUI-TASKER/VG-GUI-TASKER.