Video-Oasis: Herziening van de evaluatie van videobegrip
Video-Oasis: Rethinking Evaluation of Video Understanding
July 2, 2026
Auteurs: Geuntaek Lim, Sungjune Park, Jaeyun Lee, Inwoong Lee, Taeoh Kim, Dongyoon Wee, Minho Shim, Yukyung Choi
cs.AI
Samenvatting
De inherente complexiteit van videobegrip maakt het moeilijk te bepalen of de benchmarkprestaties van Video-LLM's voortkomen uit visuele perceptie, taalkundig redeneren of kennisprioriteiten. Hoewel er veel benchmarks zijn ontstaan om hoogwaardig redeneren te beoordelen, worden gedeelde criteria voor het evalueren van videobegrip grotendeels over het hoofd gezien. In plaats van nog een benchmark te introduceren, nemen we afstand om de criteria voor het evalueren van videobegrip opnieuw te onderzoeken. In dit werk introduceren we Video-Oasis, een duurzame diagnostische suite voor het systematisch auditen van bestaande videobegrip-benchmarks. Deze audit onthult dat 55% van de bestaande benchmarkvoorbeelden oplosbaar is zonder visuele input of temporele context. Na het filteren van deze kortsluitingen, leggen de overgebleven video-native uitdagingen een aanzienlijke capaciteitskloof bloot: state-of-the-art modellen presteren slechts marginaal boven willekeurig raden. Voortbouwend op deze bevindingen gebruiken we de gedistilleerde uitdagingen als testbed om te onderzoeken welke algoritmische ontwerpkeuzes bijdragen aan robuust videobegrip. We hopen dat ons werk een praktische basis biedt voor het construeren van rigoureuze videobenchmarks en het evalueren van toekomstige Video-LLM's. Code is beschikbaar op https://github.com/sejong-rcv/Video-Oasis.
English
The inherent complexity of video understanding makes it difficult to determine whether Video-LLM benchmark performance stems from visual perception, linguistic reasoning, or knowledge priors. While many benchmarks have emerged to assess high-level reasoning, shared criteria for evaluating video understanding remain largely overlooked. Instead of introducing yet another benchmark, we take a step back to re-examine the criteria for evaluating video understanding. In this work, we introduce Video-Oasis, a sustainable diagnostic suite for systematically auditing existing video understanding benchmarks. This audit reveals that 55\% of existing benchmark samples are solvable without visual input or temporal context. After filtering these shortcuts, the remaining video-native challenges expose a substantial capability gap: state-of-the-art models perform only marginally above random guessing. Building on these findings, we use the distilled challenges as a testbed to investigate which algorithmic design choices contribute to robust video understanding. We hope our work provides a practical foundation for constructing rigorous video benchmarks and evaluating future Video-LLMs. Code is available at https://github.com/sejong-rcv/Video-Oasis.