ChatPaper.aiChatPaper

Eén scène, twee dieptes: het onderzoeken van geometrische ambiguïteit in monoculaire funderingsmodellen

One Scene, Two Depths: Probing Geometric Ambiguity in Monocular Foundation Models

June 28, 2026
Auteurs: Xiaohao Xu, Feng Xue, Xiang Li, Haowei Li, Shusheng Yang, Tianyi Zhang, Matthew Johnson-Roberson, Xiaonan Huang
cs.AI

Samenvatting

Een betrouwbare 3D-wereldrepresentatie moet rekening houden met gelaagde geometrie, waarbij een enkele camerastraal meerdere zichtbare en geometrisch geldige oppervlakken kan bevatten. Monoculaire diepteschatting reduceert deze structuur echter tot één scalaire diepte per pixel. Transparante scènes maken deze ambiguïteit meetbaar: dezelfde straal kan door voorgrondglas gaan en de achtergrond waarnemen, waardoor het gesuperviseerde doelwit een conventie wordt van annotatie, data en training in plaats van een intrinsieke waarheid van de scène. Een aangeleerde voorspeller onthult deze conventie als zijn dieptelaagvoorkeur. We introduceren MultiDepth-3k (MD-3k), een schaarse tweelaagse ordinale benchmark voor het meten van dieptelaagvoorkeur en nauwkeurigheid van meerlaagse ruimtelijke relaties (ML-SRA). Op MD-3k vertonen toonaangevende dieptefundatiemodellen uiteenlopende laagvoorkeuren onder standaard RGB-invoer, wat aantoont dat dezelfde gelaagde geometrie op verschillende manieren kan worden opgelost door verschillende modellen. Verder vinden we dat Laplacian Visual Prompting (LVP), een trainingsvrije spectrale invoertransformatie, de gerapporteerde laag aanzienlijk kan veranderen voor bepaalde bevroren modellen. Het sterkste RGB/LVP-paar, DAv2-L, bereikt 75,5% ML-SRA. Deze resultaten suggereren dat dieptefundatiemodellen complementaire geometrische hypothesen kunnen uitdrukken die standaard RGB-inferentie onuitgedrukt laat. We nodigen de gemeenschap uit om dieptesupervisie en -evaluatie te heroverwegen door een ambiguïteitsbewuste lens, waarbij meerdere geldige 3D-interpretaties worden behandeld als geometrische structuur die moet worden gemeten, behouden en uitgedrukt.
English
A faithful 3D world representation should account for layered geometry, where a single camera ray may contain multiple visible and geometrically valid surfaces. Monocular depth estimation, however, reduces this structure to one scalar depth per pixel. Transparent scenes make this ambiguity measurable: the same ray can pass through foreground glass and observe the background, turning the supervised target into a convention of annotation, data, and training rather than a scene-intrinsic truth. A learned predictor exposes this convention as its depth-layer preference. We introduce MultiDepth-3k (MD-3k), a sparse two-layer ordinal benchmark for measuring depth-layer preference and multi-layer spatial relationship accuracy (ML-SRA). On MD-3k, leading depth foundation models exhibit diverse layer preferences under standard RGB input, showing that the same layered geometry can be resolved differently across models. We further find that Laplacian Visual Prompting (LVP), a training-free spectral input transformation, can substantially change the reported layer for certain frozen models. The strongest RGB/LVP pair, DAv2-L, reaches 75.5% ML-SRA. These results suggest that depth foundation models may express complementary geometric hypotheses that standard RGB inference leaves unexpressed. We invite the community to rethink depth supervision and evaluation through an ambiguity-aware lens, where multiple valid 3D interpretations are treated as geometric structure to be measured, preserved, and expressed.