SUFLECA: Skalierung des Feature-Lernens für die CAD-zu-Bild-Ausrichtung
SUFLECA: Scaling Up Feature Learning for CAD-to-image Alignment
July 16, 2026
Autoren: Saad Ejaz, Miguel Fernandez-Cortizas, Javier Civera, Holger Voos, Jose Luis Sanchez-Lopez
cs.AI
Zusammenfassung
Ausrichtung von CAD-Modellen auf Bilder zielt darauf ab, die 9D-Pose (Rotation, Translation und anisotroper Maßstab) eines Objekts aus einem einzelnen RGB-Bild zu schätzen, was Anwendungen in der Robotik und erweiterten Realität ermöglicht. Aktuelle Nullschuss-Methoden nutzen visuelle Grundlagenmodelle, um Bildbereiche mit CAD-Modellen abzugleichen, doch typischerweise sind ihre Korrespondenzen erscheinungsgetrieben und verschlechtern sich unter Okklusion oder Sim-to-Real-Domänenverschiebung. Um diese Einschränkungen zu überwinden, führen wir SUFLECA (Scaling Up Feature LEarning for CAD Alignment) ein, ein schwach überwachtes Framework für die Nullschuss-Ausrichtung von CAD-Modellen mit zwei zentralen Beiträgen. Erstens skaliert SUFLECA das geometriebasierte Merkmalslernen aus vortrainierten visuellen Repräsentationen durch Überwachung mit normalisierten Objektkoordinaten (NOCs) auf 674.000 Bildern aus 12 realen und synthetischen Datensätzen hoch und lernt kompakte, geometriebewusste Merkmale, die über Domänen hinweg generalisieren. Zweitens schlagen wir einen geometrisch konsistenten Abgleich-Algorithmus vor, der zuverlässige Eins-zu-Eins-Korrespondenzen zwischen CAD-Modell und Bild herstellt. Zusammen ermöglichen diese Beiträge eine genaue, unter einer Sekunde dauernde Ausrichtung pro Objektinstanz ohne iterative Posenverfeinerung. Auf ScanNet25k erreicht SUFLECA eine Kategorie-/Instanzgenauigkeit von 33,4 %/42,3 % und übertrifft damit bei geringerem Rechenaufwand die stärkste Nullschuss-Baseline um 10,3/12,2 Prozentpunkte und übertrifft auf diesem Benchmark erstmals sogar vollständig überwachte Methoden. Der Code ist verfügbar unter: https://github.com/snt-arg/SUFLECA
English
CAD-to-image alignment aims to estimate an object's 9D pose (rotation, translation, and anisotropic scale) from a single RGB image, enabling applications in robotics and augmented reality. Recent zero-shot methods use visual foundation models to match image regions to CAD models, yet typically their correspondences are appearance-driven and degrade under occlusion or sim-to-real domain shift. To address these limitations, we introduce SUFLECA (Scaling Up Feature LEarning for CAD Alignment), a weakly-supervised framework for zero-shot CAD alignment with two key contributions. First, SUFLECA scales up geometry-grounded feature learning from pretrained visual representations through Normalized Object Coordinates (NOCs) supervision on 674K images spanning 12 real and synthetic datasets, learning compact geometry-aware features that generalize across domains. Second, we propose a geometrically consistent matching algorithm that establishes reliable one-to-one CAD-to-image correspondences. Together, these contributions enable accurate, sub-second alignment per object instance without iterative pose refinement. On ScanNet25k, SUFLECA achieves 33.4%/42.3% category/instance accuracy, outperforming, with a smaller computational footprint, the strongest zero-shot baseline by 10.3/12.2 percentage points and, for the first time on this benchmark, even surpassing fully supervised methods. Code is available at: https://github.com/snt-arg/SUFLECA