Visuele pretraining voor dense ruimtelijke perceptie
Vision Pretraining for Dense Spatial Perception
July 6, 2026
Auteurs: Zelin Fu, Bin Tan, Changjiang Sun, Shaohui Liu, Kecheng Zheng, Yinghao Xu, Xing Zhu, Yujun Shen, Nan Xue
cs.AI
Samenvatting
Dichte ruimtelijke waarneming is essentieel voor fysieke intelligentie, waarbij visuele systemen worden geacht om gestructureerde, metrische en actiegerichte representaties te herstellen uit pixelobservaties. Moderne visuele basismodellen hebben doorgaans de neiging om semantische invariantie te prioriteren, vaak ten koste van gedetailleerd ruimtelijk begrip. In deze studie onderzoeken we visuele vooropleiding door een grensgerichte lens, gemotiveerd door het uitgangspunt dat grenzen en vormdiscontinuïteiten essentiële aanwijzingen bieden voor het waarnemen van geometrische eigenschappen. Concreet stellen we gemaskeerde grensmodellering voor, een zelfgecontroleerd paradigma dat dynamisch subpixel-grensrepresentaties leert en vervolgens de ontdekte grensdragende tokens gebruikt als gemaskeerde doelen om dicht visueel tokenleren te faciliteren. Door dit raamwerk op te schalen, ontwikkelen we LingBot-Vision en tonen we de doeltreffendheid ervan aan in een diverse reeks stroomafwaartse visietaken, met DINOv3 als sterke basislijn. Opmerkelijk genoeg drijft LingBot-Vision de overgang aan van LingBot-Depth 1.0 naar LingBot-Depth 2.0 voor dieptevervollediging, en levert daarmee een verbeterde diepteschatting, een belangrijke pijler voor belichaamde kunstmatige intelligentie. Onze bevindingen onthullen dat grensmodellering verder gaat dan eenvoudige lijnsegmenten en in plaats daarvan dient als een schaalbaar vooropleidingsprincipe voor het leren van ruimtelijk gestructureerde visuele representaties.
English
Dense spatial perception is essential for physical intelligence, where visual systems are expected to recover structured, metric, and actionable representations from pixel observations. Modern visual foundation models tend to prioritize semantic invariance, often at the expense of detailed spatial understanding. In this work, we study vision pretraining through a boundary-centric lens, motivated by the premise that boundaries and shape discontinuities offer essential cues for perceiving geometric properties. Concretely, we propose masked boundary modeling, a self-supervised paradigm that dynamically learns sub-pixel boundary representations and subsequently leverages the discovered boundary-bearing tokens as masked targets to facilitate dense visual token learning. By scaling this framework, we develop LingBot-Vision and demonstrate its efficacy across a diverse set of downstream vision tasks with DINOv3 as a strong baseline. Remarkably, LingBot-Vision drives the progression from LingBot-Depth 1.0 to LingBot-Depth 2.0 for depth completion, and thereby yields enhanced depth estimation, a key pillar for embodied artificial intelligence. Our findings reveal that boundary modeling goes beyond simple line segments and instead serves as a scalable pretraining principle for learning spatially structured visual representations.