ChatPaper.aiChatPaper

SUFLECA: Масштабирование обучения признаков для выравнивания CAD и изображений

SUFLECA: Scaling Up Feature Learning for CAD-to-image Alignment

July 16, 2026
Авторы: Saad Ejaz, Miguel Fernandez-Cortizas, Javier Civera, Holger Voos, Jose Luis Sanchez-Lopez
cs.AI

Аннотация

Выравнивание CAD-изображений направлено на оценку 9D-позы объекта (вращение, перемещение и анизотропный масштаб) по одному RGB-изображению, что находит применение в робототехнике и дополненной реальности. Современные методы без обучения (zero-shot) используют модели визуального основания для сопоставления областей изображения с CAD-моделями, однако их соответствия, как правило, управляются внешним видом и деградируют при окклюзии или переходе от симуляции к реальности. Для преодоления этих ограничений мы представляем SUFLECA (Scaling Up Feature LEarning for CAD Alignment) — слабо контролируемую структуру для выравнивания CAD без обучения с двумя ключевыми вкладами. Во-первых, SUFLECA масштабирует обучение признаков, основанных на геометрии, из предварительно обученных визуальных представлений с помощью супервизии нормализованных координат объекта (NOCs) на 674 000 изображений из 12 реальных и синтетических наборов данных, изучая компактные геометрически осведомленные признаки, обобщаемые между доменами. Во-вторых, мы предлагаем геометрически согласованный алгоритм сопоставления, устанавливающий надежные взаимно-однозначные соответствия CAD-изображения. Совместно эти вклады обеспечивают точное выравнивание за доли секунды для каждого экземпляра объекта без итеративного уточнения позы. На наборе данных ScanNet25k SUFLECA достигает точности 33.4%/42.3% для категорий/экземпляров, превосходя (при меньшей вычислительной нагрузке) сильнейший базовый метод без обучения на 10.3/12.2 процентных пункта и впервые на этом эталоне даже превосходя полностью контролируемые методы. Код доступен по адресу: https://github.com/snt-arg/SUFLECA
English
CAD-to-image alignment aims to estimate an object's 9D pose (rotation, translation, and anisotropic scale) from a single RGB image, enabling applications in robotics and augmented reality. Recent zero-shot methods use visual foundation models to match image regions to CAD models, yet typically their correspondences are appearance-driven and degrade under occlusion or sim-to-real domain shift. To address these limitations, we introduce SUFLECA (Scaling Up Feature LEarning for CAD Alignment), a weakly-supervised framework for zero-shot CAD alignment with two key contributions. First, SUFLECA scales up geometry-grounded feature learning from pretrained visual representations through Normalized Object Coordinates (NOCs) supervision on 674K images spanning 12 real and synthetic datasets, learning compact geometry-aware features that generalize across domains. Second, we propose a geometrically consistent matching algorithm that establishes reliable one-to-one CAD-to-image correspondences. Together, these contributions enable accurate, sub-second alignment per object instance without iterative pose refinement. On ScanNet25k, SUFLECA achieves 33.4%/42.3% category/instance accuracy, outperforming, with a smaller computational footprint, the strongest zero-shot baseline by 10.3/12.2 percentage points and, for the first time on this benchmark, even surpassing fully supervised methods. Code is available at: https://github.com/snt-arg/SUFLECA