ChatPaper.aiChatPaper

Susciter le raisonnement spatial complexe dans les MLLMs par la mise en correspondance à large base

Eliciting Complex Spatial Reasoning in MLLMs through Wide-Baseline Matching

June 2, 2026
Auteurs: Hao Zhong, Muzhi Zhu, Shenyan Zeng, Anzhou Li, Cong Chen, Hua Geng, Duochao Shi, Wentao Ye, Tao Lin, Hao Chen, Chunhua Shen
cs.AI

Résumé

L'appariement à grande ligne de base (WBM) nécessite l'intégration de la compréhension géométrique, des changements de point de vue, de la perception à grain fin et du raisonnement sur les occlusions, ce qui en fait un banc d'essai exigeant pour le raisonnement spatial dans les modèles de langage de grande taille multimodaux (MLLMs) déployés dans des environnements physiques. Cependant, les MLLMs actuels manquent de cadres systématiques d'évaluation et d'entraînement pour ces capacités. Nous présentons ReasonMatch-Bench, un benchmark stratifié par déplacement du point de vue et granularité d'appariement dans des scénarios intérieurs, extérieurs et centrés sur les objets, et montrons que les MLLMs actuels peinent encore avec les correspondances à grande ligne de base à grain fin : sur un sous-ensemble difficile de 90 échantillons, les annotateurs humains atteignent un F1 de 84,0, tandis que la meilleure baseline existante obtient 37,2. Pour combler cet écart, nous construisons un pipeline de génération de données évolutif qui extrait automatiquement des paires de vues à grande ligne de base à partir de corpus vidéo-3D à grande échelle, y compris des vidéos RVB-D et des reconstructions SfM, produisant une supervision diversifiée et vérifiable. Nous proposons en outre l'apprentissage par renforcement par correspondance dynamique (DCRL), qui combine une progression du point de vue au niveau de l'image et un curriculum de correspondances au niveau des points pour améliorer l'entraînement WBM via des récompenses vérifiables sans supervision explicite de chaîne de pensée (CoT). Des expériences approfondies montrent que DCRL améliore considérablement ReasonMatch-Bench et se transpose à des benchmarks spatiaux connexes, tout en maintenant les performances de compréhension visuelle générale avec des gains modestes sur plusieurs benchmarks.
English
Wide-baseline matching (WBM) requires integrating geometric understanding, viewpoint changes, fine-grained perception, and occlusion reasoning, making it a challenging testbed for spatial reasoning in multimodal large language models (MLLMs) deployed in physical environments. However, current MLLMs lack systematic evaluation and training frameworks for these capabilities. We introduce ReasonMatch-Bench, a benchmark stratified by viewpoint displacement and matching granularity across indoor, outdoor, and object-centric scenarios, and show that current MLLMs still struggle with fine-grained wide-baseline correspondence: on a difficult 90-sample subset, human annotators achieve 84.0 F1, while the best existing baseline reaches 37.2. To bridge this gap, we build a scalable data-generation pipeline that automatically extracts wide-baseline view pairs from large-scale video-3D corpora, including RGB-D videos and SfM reconstructions, yielding diverse and verifiable supervision. We further propose Dynamic Correspondence Reinforcement Learning (DCRL), which combines Image-Level Viewpoint Progression and Point-Level Correspondence Curriculum to improve WBM training through verifiable rewards without explicit CoT supervision. Extensive experiments show that DCRL substantially improves ReasonMatch-Bench and transfers to related spatial benchmarks, while maintaining general visual understanding performance with modest gains on several benchmarks.