AnyGroundBench: Um Benchmark de Domínio Especializado para Ancoragem de Vídeo em Modelos de Visão e Linguagem
AnyGroundBench: A Specialized-Domain Benchmark for Video Grounding in Vision-Language Models
July 2, 2026
Autores: Rintaro Otsubo, Ryo Fujii, Reina Ishikawa, Taiki Kanaya, Kanta Sawafuji, Hiroki Kajita, Shigeki Sakai, Hideo Saito, Ryo Hachiuma
cs.AI
Resumo
Modelos de Visão-Linguagem (VLMs) têm demonstrado imenso potencial no Grounding Espaço-Temporal de Vídeos (STVG). No entanto, os protocolos de avaliação atuais estão amplamente confinados a avaliações zero-shot em benchmarks gerais do cotidiano. Isso cria uma desconexão crítica em relação às aplicações do mundo real em áreas especializadas, onde os modelos inevitavelmente encontram conceitos visuais raros e dinâmicas espaço-temporais complexas. Como o pré-treinamento exaustivo em distribuições infinitas de dados é inviável, a capacidade de adaptação a novos domínios é essencial. Para preencher essa lacuna, apresentamos o AnyGroundBench, um benchmark de adaptação de domínio projetado para mudar o paradigma de avaliação do STVG de testes zero-shot estáticos para uma adaptação rigorosa de domínio. Visando cinco domínios especializados (animal, indústria, esportes, cirurgia e segurança pública), o AnyGroundBench combina vídeos recém-capturados, como comportamentos de camundongos anotados por especialistas, com conjuntos de dados estabelecidos, unificando-os por meio de anotações espaço-temporais densas e de alta fidelidade. Crucialmente, o benchmark fornece subconjuntos de treinamento dedicados para medir sistematicamente a adaptabilidade ao domínio. Avaliamos extensivamente 15 VLMs de última geração, avaliando sua generalização zero-shot e capacidades de Aprendizado no Contexto (ICL) sob restrições computacionais práticas. Por fim, nossas descobertas revelam que os modelos atuais falham tanto na adaptação zero-shot quanto na baseada em ICL quando confrontados com domínios especializados, expondo falhas críticas no raciocínio espaço-temporal que pesquisas futuras devem abordar.
English
Vision-Language Models (VLMs) have demonstrated immense promise in Spatio-Temporal Video Grounding (STVG). However, current evaluation protocols are largely confined to zero-shot assessments on general, daily-life benchmarks. This creates a critical disconnect from real-world applications in specialized fields, where models inevitably encounter rare visual concepts and complex spatio-temporal dynamics. Since exhaustive pre-training across infinite data distributions is infeasible, the ability to adapt to novel domains is essential. To bridge this gap, we introduce AnyGroundBench, a domain-adaptation benchmark designed to shift the STVG evaluation paradigm from static zero-shot testing to rigorous domain adaptation. Targeting five specialized domains (animal, industry, sports, surgery, and public security), AnyGroundBench pairs newly captured videos such as expert-annotated mouse behaviors with established datasets, unifying them through dense, high-fidelity spatio-temporal annotations. Crucially, the benchmark provides dedicated training subsets to systematically measure domain adaptability. We extensively evaluate 15 state-of-the-art VLMs, assessing their zero-shot generalization and In-Context Learning (ICL) capabilities under practical computational constraints. Ultimately, our findings reveal that current models fail in both zero-shot and ICL-based adaptation when confronted with specialized domains, exposing critical flaws in spatio-temporal reasoning that future research must address.