Video-Oasis: Repensando la Evaluación de la Comprensión de Video
Video-Oasis: Rethinking Evaluation of Video Understanding
July 2, 2026
Autores: Geuntaek Lim, Sungjune Park, Jaeyun Lee, Inwoong Lee, Taeoh Kim, Dongyoon Wee, Minho Shim, Yukyung Choi
cs.AI
Resumen
La complejidad inherente de la comprensión de video dificulta determinar si el rendimiento de los benchmarks de Video-LLM proviene de la percepción visual, el razonamiento lingüístico o los conocimientos previos. Si bien han surgido muchos benchmarks para evaluar el razonamiento de alto nivel, los criterios compartidos para evaluar la comprensión de video siguen siendo en gran medida ignorados. En lugar de introducir un benchmark más, retrocedemos para reexaminar los criterios para evaluar la comprensión de video. En este trabajo, presentamos Video-Oasis, un conjunto de diagnóstico sostenible para auditar sistemáticamente los benchmarks existentes de comprensión de video. Esta auditoría revela que el 55 % de las muestras de benchmarks existentes se pueden resolver sin entrada visual o contexto temporal. Después de filtrar estos atajos, los desafíos restantes nativos de video exponen una brecha de capacidad sustancial: los modelos de última generación se desempeñan solo marginalmente por encima de la adivinación aleatoria. Basándonos en estos hallazgos, utilizamos los desafíos destilados como banco de pruebas para investigar qué elecciones de diseño algorítmico contribuyen a una comprensión robusta de video. Esperamos que nuestro trabajo proporcione una base práctica para construir benchmarks de video rigurosos y evaluar futuros Video-LLMs. El código está disponible en https://github.com/sejong-rcv/Video-Oasis.
English
The inherent complexity of video understanding makes it difficult to determine whether Video-LLM benchmark performance stems from visual perception, linguistic reasoning, or knowledge priors. While many benchmarks have emerged to assess high-level reasoning, shared criteria for evaluating video understanding remain largely overlooked. Instead of introducing yet another benchmark, we take a step back to re-examine the criteria for evaluating video understanding. In this work, we introduce Video-Oasis, a sustainable diagnostic suite for systematically auditing existing video understanding benchmarks. This audit reveals that 55\% of existing benchmark samples are solvable without visual input or temporal context. After filtering these shortcuts, the remaining video-native challenges expose a substantial capability gap: state-of-the-art models perform only marginally above random guessing. Building on these findings, we use the distilled challenges as a testbed to investigate which algorithmic design choices contribute to robust video understanding. We hope our work provides a practical foundation for constructing rigorous video benchmarks and evaluating future Video-LLMs. Code is available at https://github.com/sejong-rcv/Video-Oasis.