SUFLECA: Opschalen van feature learning voor CAD-naar-beeld-uitlijning
SUFLECA: Scaling Up Feature Learning for CAD-to-image Alignment
July 16, 2026
Auteurs: Saad Ejaz, Miguel Fernandez-Cortizas, Javier Civera, Holger Voos, Jose Luis Sanchez-Lopez
cs.AI
Samenvatting
CAD-naar-beeld uitlijning heeft als doel de 9D pose (rotatie, translatie en anisotrope schaal) van een object te schatten uit een enkele RGB-afbeelding, wat toepassingen in robotica en augmented reality mogelijk maakt. Recente zero-shot methoden gebruiken visuele funderingsmodellen om beeldregio's te matchen met CAD-modellen, maar doorgaans zijn hun correspondenties uiterlijk-gedreven en verslechteren ze onder occlusie of sim-to-real domeinverschuiving. Om deze beperkingen aan te pakken, introduceren we SUFLECA (Scaling Up Feature LEarning for CAD Alignment), een zwak-gesuperviseerd raamwerk voor zero-shot CAD-uitlijning met twee belangrijke bijdragen. Ten eerste schaalt SUFLECA de geometrie-gefundeerde feature learning op van voorgetrainde visuele representaties door middel van Normalized Object Coordinates (NOCs) supervisie op 674K afbeeldingen verdeeld over 12 echte en synthetische datasets, waarbij compacte geometrie-bewuste features worden geleerd die generaliseren over domeinen heen. Ten tweede stellen we een geometrisch consistent matching-algoritme voor dat betrouwbare één-op-één CAD-naar-beeld correspondenties tot stand brengt. Samen maken deze bijdragen nauwkeurige, sub-seconde uitlijning per objectinstantie mogelijk zonder iteratieve pose-verfijning. Op ScanNet25k behaalt SUFLECA 33,4%/42,3% categorie-/instantienauwkeurigheid, waarmee het, met een kleinere computationele voetafdruk, de sterkste zero-shot baseline met 10,3/12,2 procentpunten overtreft en, voor het eerst op deze benchmark, zelfs volledig gesuperviseerde methoden overtreft. Code is beschikbaar op: https://github.com/snt-arg/SUFLECA
English
CAD-to-image alignment aims to estimate an object's 9D pose (rotation, translation, and anisotropic scale) from a single RGB image, enabling applications in robotics and augmented reality. Recent zero-shot methods use visual foundation models to match image regions to CAD models, yet typically their correspondences are appearance-driven and degrade under occlusion or sim-to-real domain shift. To address these limitations, we introduce SUFLECA (Scaling Up Feature LEarning for CAD Alignment), a weakly-supervised framework for zero-shot CAD alignment with two key contributions. First, SUFLECA scales up geometry-grounded feature learning from pretrained visual representations through Normalized Object Coordinates (NOCs) supervision on 674K images spanning 12 real and synthetic datasets, learning compact geometry-aware features that generalize across domains. Second, we propose a geometrically consistent matching algorithm that establishes reliable one-to-one CAD-to-image correspondences. Together, these contributions enable accurate, sub-second alignment per object instance without iterative pose refinement. On ScanNet25k, SUFLECA achieves 33.4%/42.3% category/instance accuracy, outperforming, with a smaller computational footprint, the strongest zero-shot baseline by 10.3/12.2 percentage points and, for the first time on this benchmark, even surpassing fully supervised methods. Code is available at: https://github.com/snt-arg/SUFLECA