ChatPaper.aiChatPaper

SUFLECA: Ampliación del Aprendizaje de Características para la Alineación de CAD a Imagen

SUFLECA: Scaling Up Feature Learning for CAD-to-image Alignment

July 16, 2026
Autores: Saad Ejaz, Miguel Fernandez-Cortizas, Javier Civera, Holger Voos, Jose Luis Sanchez-Lopez
cs.AI

Resumen

La alineación CAD-imagen tiene como objetivo estimar la pose 9D de un objeto (rotación, traslación y escala anisotrópica) a partir de una única imagen RGB, lo que permite aplicaciones en robótica y realidad aumentada. Métodos recientes de zero-shot utilizan modelos fundacionales visuales para emparejar regiones de imagen con modelos CAD, pero típicamente sus correspondencias están basadas en apariencia y se degradan bajo oclusión o cambio de dominio sim-to-real. Para abordar estas limitaciones, introducimos SUFLECA (Scaling Up Feature LEarning for CAD Alignment), un marco débilmente supervisado para alineación CAD zero-shot con dos contribuciones clave. Primero, SUFLECA escala el aprendizaje de características basadas en geometría a partir de representaciones visuales preentrenadas mediante supervisión de Coordenadas Normalizadas de Objeto (NOCs) en 674K imágenes que abarcan 12 conjuntos de datos reales y sintéticos, aprendiendo características compactas conscientes de la geometría que se generalizan a través de dominios. Segundo, proponemos un algoritmo de correspondencia geométricamente consistente que establece correspondencias fiables uno a uno entre CAD e imagen. En conjunto, estas contribuciones permiten una alineación precisa y subsegundo por instancia de objeto sin refinamiento iterativo de pose. En ScanNet25k, SUFLECA alcanza una precisión de categoría/instancia del 33.4%/42.3%, superando, con una huella computacional menor, al mejor baseline zero-shot por 10.3/12.2 puntos porcentuales y, por primera vez en este benchmark, incluso superando a métodos completamente supervisados. El código está disponible en: https://github.com/snt-arg/SUFLECA
English
CAD-to-image alignment aims to estimate an object's 9D pose (rotation, translation, and anisotropic scale) from a single RGB image, enabling applications in robotics and augmented reality. Recent zero-shot methods use visual foundation models to match image regions to CAD models, yet typically their correspondences are appearance-driven and degrade under occlusion or sim-to-real domain shift. To address these limitations, we introduce SUFLECA (Scaling Up Feature LEarning for CAD Alignment), a weakly-supervised framework for zero-shot CAD alignment with two key contributions. First, SUFLECA scales up geometry-grounded feature learning from pretrained visual representations through Normalized Object Coordinates (NOCs) supervision on 674K images spanning 12 real and synthetic datasets, learning compact geometry-aware features that generalize across domains. Second, we propose a geometrically consistent matching algorithm that establishes reliable one-to-one CAD-to-image correspondences. Together, these contributions enable accurate, sub-second alignment per object instance without iterative pose refinement. On ScanNet25k, SUFLECA achieves 33.4%/42.3% category/instance accuracy, outperforming, with a smaller computational footprint, the strongest zero-shot baseline by 10.3/12.2 percentage points and, for the first time on this benchmark, even surpassing fully supervised methods. Code is available at: https://github.com/snt-arg/SUFLECA