ReVSI : Reconstruction de l'évaluation de l'intelligence visuo-spatiale pour une évaluation précise du raisonnement 3D des modèles de vision et langage
ReVSI: Rebuilding Visual Spatial Intelligence Evaluation for Accurate Assessment of VLM 3D Reasoning
April 27, 2026
Auteurs: Yiming Zhang, Jiacheng Chen, Jiaqi Tan, Yongsen Mao, Wenhu Chen, Angel X. Chang
cs.AI
Résumé
Les évaluations actuelles de l'intelligence spatiale peuvent être systématiquement non valides dans le contexte des modèles vision-langage (VLM) modernes. Premièrement, de nombreuses références dérivent des paires question-réponse (QR) d'annotations 3D basées sur des nuages de points, initialement conçues pour la perception 3D traditionnelle. Lorsque ces annotations sont utilisées comme vérité terrain pour une évaluation vidéo, les artefacts de reconstruction et d'annotation peuvent omettre des objets clairement visibles dans la vidéo, étiqueter incorrectement les identités des objets ou corrompre les réponses dépendantes de la géométrie (par exemple, la taille), produisant ainsi des paires QR incorrectes ou ambiguës. Deuxièmement, les évaluations supposent souvent un accès à la scène complète, alors que de nombreux VLMs fonctionnent sur des images échantillonnées de manière éparse (par exemple, 16-64), rendant de nombreuses questions essentiellement impossibles à résoudre avec les entrées réelles du modèle. Nous améliorons la validité de l'évaluation en introduisant ReVSI, un benchmark et un protocole qui garantissent que chaque paire QR est répondable et correcte avec les entrées réelles du modèle. Pour ce faire, nous ré-annotons les objets et la géométrie dans 381 scènes issues de 5 jeux de données pour améliorer la qualité des données, et régénérons toutes les paires QR avec une atténuation rigoureuse des biais et une vérification humaine à l'aide d'outils professionnels d'annotation 3D. Nous améliorons également la contrôlabilité de l'évaluation en proposant des variantes pour différents budgets d'images (16/32/64/toutes) et des métadonnées fines sur la visibilité des objets, permettant des analyses diagnostiques contrôlées. Les évaluations de VLMs généraux et spécialisés sur ReVSI révèlent des modes d'échec systématiques masqués par les benchmarks antérieurs, offrant une évaluation plus fiable et diagnostique de l'intelligence spatiale.
English
Current evaluations of spatial intelligence can be systematically invalid under modern vision-language model (VLM) settings. First, many benchmarks derive question-answer (QA) pairs from point-cloud-based 3D annotations originally curated for traditional 3D perception. When such annotations are treated as ground truth for video-based evaluation, reconstruction and annotation artifacts can miss objects that are clearly visible in the video, mislabel object identities, or corrupt geometry-dependent answers (e.g., size), yielding incorrect or ambiguous QA pairs. Second, evaluations often assume full-scene access, while many VLMs operate on sparsely sampled frames (e.g., 16-64), making many questions effectively unanswerable under the actual model inputs. We improve evaluation validity by introducing ReVSI, a benchmark and protocol that ensures each QA pair is answerable and correct under the model's actual inputs. To this end, we re-annotate objects and geometry across 381 scenes from 5 datasets to improve data quality, and regenerate all QA pairs with rigorous bias mitigation and human verification using professional 3D annotation tools. We further enhance evaluation controllability by providing variants across multiple frame budgets (16/32/64/all) and fine-grained object visibility metadata, enabling controlled diagnostic analyses. Evaluations of general and domain-specific VLMs on ReVSI reveal systematic failure modes that are obscured by prior benchmarks, yielding a more reliable and diagnostic assessment of spatial intelligence.