Preentrenamiento de visión para percepción espacial densa
Vision Pretraining for Dense Spatial Perception
July 6, 2026
Autores: Zelin Fu, Bin Tan, Changjiang Sun, Shaohui Liu, Kecheng Zheng, Yinghao Xu, Xing Zhu, Yujun Shen, Nan Xue
cs.AI
Resumen
La percepción espacial densa es esencial para la inteligencia física, donde se espera que los sistemas visuales recuperen representaciones estructuradas, métricas y procesables a partir de observaciones de píxeles. Los modelos visuales fundacionales modernos tienden a priorizar la invariancia semántica, a menudo a expensas de una comprensión espacial detallada. En este trabajo, estudiamos el preentrenamiento visual desde una perspectiva centrada en los bordes, motivados por la premisa de que los bordes y las discontinuidades de forma ofrecen señales esenciales para percibir propiedades geométricas. Concretamente, proponemos el modelado enmascarado de bordes, un paradigma auto-supervisado que aprende dinámicamente representaciones de bordes a nivel de subpíxel y posteriormente aprovecha los tokens portadores de bordes descubiertos como objetivos enmascarados para facilitar el aprendizaje de tokens visuales densos. Al escalar este marco, desarrollamos LingBot-Vision y demostramos su eficacia en un conjunto diverso de tareas visuales posteriores utilizando DINOv3 como referencia sólida. Notablemente, LingBot-Vision impulsa la progresión de LingBot-Depth 1.0 a LingBot-Depth 2.0 para la completación de profundidad, y por ende produce una estimación de profundidad mejorada, un pilar clave para la inteligencia artificial corpórea. Nuestros hallazgos revelan que el modelado de bordes va más allá de simples segmentos de línea y, en cambio, sirve como un principio de preentrenamiento escalable para aprender representaciones visuales estructuradas espacialmente.
English
Dense spatial perception is essential for physical intelligence, where visual systems are expected to recover structured, metric, and actionable representations from pixel observations. Modern visual foundation models tend to prioritize semantic invariance, often at the expense of detailed spatial understanding. In this work, we study vision pretraining through a boundary-centric lens, motivated by the premise that boundaries and shape discontinuities offer essential cues for perceiving geometric properties. Concretely, we propose masked boundary modeling, a self-supervised paradigm that dynamically learns sub-pixel boundary representations and subsequently leverages the discovered boundary-bearing tokens as masked targets to facilitate dense visual token learning. By scaling this framework, we develop LingBot-Vision and demonstrate its efficacy across a diverse set of downstream vision tasks with DINOv3 as a strong baseline. Remarkably, LingBot-Vision drives the progression from LingBot-Depth 1.0 to LingBot-Depth 2.0 for depth completion, and thereby yields enhanced depth estimation, a key pillar for embodied artificial intelligence. Our findings reveal that boundary modeling goes beyond simple line segments and instead serves as a scalable pretraining principle for learning spatially structured visual representations.