Uma Cena, Duas Profundidades: Investigando a Ambiguidade Geométrica em Modelos de Base Monoculares
One Scene, Two Depths: Probing Geometric Ambiguity in Monocular Foundation Models
June 28, 2026
Autores: Xiaohao Xu, Feng Xue, Xiang Li, Haowei Li, Shusheng Yang, Tianyi Zhang, Matthew Johnson-Roberson, Xiaonan Huang
cs.AI
Resumo
Uma representação fiel do mundo 3D deve considerar a geometria em camadas, onde um único raio de câmera pode conter múltiplas superfícies visíveis e geometricamente válidas. A estimativa de profundidade monocular, no entanto, reduz essa estrutura a um escalar de profundidade por pixel. Cenas transparentes tornam essa ambiguidade mensurável: o mesmo raio pode atravessar um vidro em primeiro plano e observar o fundo, transformando o alvo supervisionado em uma convenção de anotação, dados e treinamento, e não em uma verdade intrínseca da cena. Um preditor aprendido expõe essa convenção como sua preferência de camada de profundidade. Apresentamos o MultiDepth-3k (MD-3k), um benchmark ordinal esparso de duas camadas para medir a preferência de camada de profundidade e a precisão da relação espacial multicamadas (ML-SRA). No MD-3k, modelos líderes de profundidade fundamentais exibem preferências de camada diversas sob entrada RGB padrão, mostrando que a mesma geometria em camadas pode ser resolvida de forma diferente entre modelos. Descobrimos ainda que o Laplacian Visual Prompting (LVP), uma transformação espectral de entrada livre de treinamento, pode alterar substancialmente a camada relatada para certos modelos congelados. O par RGB/LVP mais forte, DAv2-L, atinge 75,5% de ML-SRA. Esses resultados sugerem que modelos de profundidade fundamentais podem expressar hipóteses geométricas complementares que a inferência RGB padrão deixa inexpressas. Convidamos a comunidade a repensar a supervisão e a avaliação de profundidade através de uma lente ciente da ambiguidade, onde múltiplas interpretações 3D válidas são tratadas como estrutura geométrica a ser medida, preservada e expressa.
English
A faithful 3D world representation should account for layered geometry, where a single camera ray may contain multiple visible and geometrically valid surfaces. Monocular depth estimation, however, reduces this structure to one scalar depth per pixel. Transparent scenes make this ambiguity measurable: the same ray can pass through foreground glass and observe the background, turning the supervised target into a convention of annotation, data, and training rather than a scene-intrinsic truth. A learned predictor exposes this convention as its depth-layer preference. We introduce MultiDepth-3k (MD-3k), a sparse two-layer ordinal benchmark for measuring depth-layer preference and multi-layer spatial relationship accuracy (ML-SRA). On MD-3k, leading depth foundation models exhibit diverse layer preferences under standard RGB input, showing that the same layered geometry can be resolved differently across models. We further find that Laplacian Visual Prompting (LVP), a training-free spectral input transformation, can substantially change the reported layer for certain frozen models. The strongest RGB/LVP pair, DAv2-L, reaches 75.5% ML-SRA. These results suggest that depth foundation models may express complementary geometric hypotheses that standard RGB inference leaves unexpressed. We invite the community to rethink depth supervision and evaluation through an ambiguity-aware lens, where multiple valid 3D interpretations are treated as geometric structure to be measured, preserved, and expressed.