ChatPaper.aiChatPaper

SUFLECA : Passage à l'échelle de l'apprentissage de caractéristiques pour l'alignement CAD-image

SUFLECA: Scaling Up Feature Learning for CAD-to-image Alignment

July 16, 2026
Auteurs: Saad Ejaz, Miguel Fernandez-Cortizas, Javier Civera, Holger Voos, Jose Luis Sanchez-Lopez
cs.AI

Résumé

L'alignement CAO-image vise à estimer la pose 9D d'un objet (rotation, translation et échelle anisotrope) à partir d'une seule image RVB, permettant des applications en robotique et en réalité augmentée. Les récentes méthodes zero-shot utilisent des modèles de base visuels pour mettre en correspondance des régions d'image avec des modèles CAO, mais leurs correspondances sont généralement basées sur l'apparence et se dégradent en cas d'occlusion ou de changement de domaine sim-vers-réel. Pour remédier à ces limitations, nous présentons SUFLECA (Scaling Up Feature LEarning for CAD Alignment), un cadre faiblement supervisé pour l'alignement CAO zero-shot avec deux contributions clés. Premièrement, SUFLECA amplifie l'apprentissage de caractéristiques ancrées dans la géométrie à partir de représentations visuelles pré-entraînées, via une supervision par Coordonnées d'Objet Normalisées (NOCs) sur 674K images couvrant 12 ensembles de données réels et synthétiques, apprenant des caractéristiques compactes conscientes de la géométrie qui se généralisent à travers les domaines. Deuxièmement, nous proposons un algorithme de mise en correspondance géométriquement cohérent qui établit des correspondances CAO-image fiables un-à-un. Ensemble, ces contributions permettent un alignement précis et inférieur à la seconde par instance d'objet, sans raffinement itératif de pose. Sur ScanNet25k, SUFLECA atteint 33,4 %/42,3 % de précision par catégorie/instance, surpassant, avec une empreinte de calcul plus faible, la baseline zero-shot la plus forte de 10,3/12,2 points de pourcentage et, pour la première fois sur ce benchmark, surpassant même les méthodes entièrement supervisées. Le code est disponible à l'adresse : https://github.com/snt-arg/SUFLECA
English
CAD-to-image alignment aims to estimate an object's 9D pose (rotation, translation, and anisotropic scale) from a single RGB image, enabling applications in robotics and augmented reality. Recent zero-shot methods use visual foundation models to match image regions to CAD models, yet typically their correspondences are appearance-driven and degrade under occlusion or sim-to-real domain shift. To address these limitations, we introduce SUFLECA (Scaling Up Feature LEarning for CAD Alignment), a weakly-supervised framework for zero-shot CAD alignment with two key contributions. First, SUFLECA scales up geometry-grounded feature learning from pretrained visual representations through Normalized Object Coordinates (NOCs) supervision on 674K images spanning 12 real and synthetic datasets, learning compact geometry-aware features that generalize across domains. Second, we propose a geometrically consistent matching algorithm that establishes reliable one-to-one CAD-to-image correspondences. Together, these contributions enable accurate, sub-second alignment per object instance without iterative pose refinement. On ScanNet25k, SUFLECA achieves 33.4%/42.3% category/instance accuracy, outperforming, with a smaller computational footprint, the strongest zero-shot baseline by 10.3/12.2 percentage points and, for the first time on this benchmark, even surpassing fully supervised methods. Code is available at: https://github.com/snt-arg/SUFLECA