Pré-entraînement de la vision pour la perception spatiale dense
Vision Pretraining for Dense Spatial Perception
July 6, 2026
Auteurs: Zelin Fu, Bin Tan, Changjiang Sun, Shaohui Liu, Kecheng Zheng, Yinghao Xu, Xing Zhu, Yujun Shen, Nan Xue
cs.AI
Résumé
La perception spatiale dense est essentielle pour l’intelligence physique, où il est attendu des systèmes visuels qu’ils reconstruisent des représentations structurées, métriques et actionnables à partir d’observations de pixels. Les modèles de base visuels modernes tendent à privilégier l’invariance sémantique, souvent au détriment d’une compréhension spatiale détaillée. Dans ce travail, nous étudions le préentraînement visuel sous un angle centré sur les contours, motivés par l’idée que les contours et les discontinuités de forme fournissent des indices essentiels pour percevoir les propriétés géométriques. Concrètement, nous proposons le modélisation masquée des contours, un paradigme auto-supervisé qui apprend dynamiquement des représentations de contours subpixelliques, puis utilise les jetons porteurs de contours ainsi découverts comme cibles masquées pour faciliter l’apprentissage dense de jetons visuels. En passant à l’échelle ce cadre, nous développons LingBot-Vision et démontrons son efficacité sur un ensemble diversifié de tâches visuelles en aval, en prenant DINOv3 comme référence solide. Fait remarquable, LingBot-Vision permet le passage de LingBot-Depth 1.0 à LingBot-Depth 2.0 pour la complétion de profondeur, améliorant ainsi l’estimation de profondeur, pilier clé de l’intelligence artificielle incarnée. Nos résultats révèlent que la modélisation des contours va au-delà de simples segments de ligne et constitue plutôt un principe de préentraînement passant à l’échelle pour apprendre des représentations visuelles spatialement structurées.
English
Dense spatial perception is essential for physical intelligence, where visual systems are expected to recover structured, metric, and actionable representations from pixel observations. Modern visual foundation models tend to prioritize semantic invariance, often at the expense of detailed spatial understanding. In this work, we study vision pretraining through a boundary-centric lens, motivated by the premise that boundaries and shape discontinuities offer essential cues for perceiving geometric properties. Concretely, we propose masked boundary modeling, a self-supervised paradigm that dynamically learns sub-pixel boundary representations and subsequently leverages the discovered boundary-bearing tokens as masked targets to facilitate dense visual token learning. By scaling this framework, we develop LingBot-Vision and demonstrate its efficacy across a diverse set of downstream vision tasks with DINOv3 as a strong baseline. Remarkably, LingBot-Vision drives the progression from LingBot-Depth 1.0 to LingBot-Depth 2.0 for depth completion, and thereby yields enhanced depth estimation, a key pillar for embodied artificial intelligence. Our findings reveal that boundary modeling goes beyond simple line segments and instead serves as a scalable pretraining principle for learning spatially structured visual representations.