Pré-treinamento de Visão para Percepção Espacial Densa
Vision Pretraining for Dense Spatial Perception
July 6, 2026
Autores: Zelin Fu, Bin Tan, Changjiang Sun, Shaohui Liu, Kecheng Zheng, Yinghao Xu, Xing Zhu, Yujun Shen, Nan Xue
cs.AI
Resumo
A percepção espacial densa é essencial para a inteligência física, onde se espera que sistemas visuais recuperem representações estruturadas, métricas e acionáveis a partir de observações de pixels. Os modelos fundamentais visuais modernos tendem a priorizar a invariância semântica, muitas vezes em detrimento de uma compreensão espacial detalhada. Neste trabalho, estudamos o pré-treinamento visual sob uma ótica centrada em contornos, motivados pela premissa de que contornos e descontinuidades de forma oferecem pistas essenciais para a percepção de propriedades geométricas. Concretamente, propomos a modelagem mascarada de contornos, um paradigma auto-supervisionado que aprende dinamicamente representações de contornos em sub-pixels e, posteriormente, utiliza os tokens portadores de contornos descobertos como alvos mascarados para facilitar o aprendizado denso de tokens visuais. Ao escalar esta estrutura, desenvolvemos o LingBot-Vision e demonstramos sua eficácia em um conjunto diversificado de tarefas visuais downstream, tendo o DINOv3 como uma base forte. Notavelmente, o LingBot-Vision impulsiona a progressão do LingBot-Depth 1.0 para o LingBot-Depth 2.0 na tarefa de complementação de profundidade, resultando assim em uma estimativa de profundidade aprimorada, um pilar fundamental para a inteligência artificial corporificada. Nossos achados revelam que a modelagem de contornos vai além de simples segmentos de linha, servindo, em vez disso, como um princípio escalável de pré-treinamento para aprender representações visuais espacialmente estruturadas.
English
Dense spatial perception is essential for physical intelligence, where visual systems are expected to recover structured, metric, and actionable representations from pixel observations. Modern visual foundation models tend to prioritize semantic invariance, often at the expense of detailed spatial understanding. In this work, we study vision pretraining through a boundary-centric lens, motivated by the premise that boundaries and shape discontinuities offer essential cues for perceiving geometric properties. Concretely, we propose masked boundary modeling, a self-supervised paradigm that dynamically learns sub-pixel boundary representations and subsequently leverages the discovered boundary-bearing tokens as masked targets to facilitate dense visual token learning. By scaling this framework, we develop LingBot-Vision and demonstrate its efficacy across a diverse set of downstream vision tasks with DINOv3 as a strong baseline. Remarkably, LingBot-Vision drives the progression from LingBot-Depth 1.0 to LingBot-Depth 2.0 for depth completion, and thereby yields enhanced depth estimation, a key pillar for embodied artificial intelligence. Our findings reveal that boundary modeling goes beyond simple line segments and instead serves as a scalable pretraining principle for learning spatially structured visual representations.