Modélisation 3D de scènes par propagation avant : une perspective axée sur les problèmes
Feed-Forward 3D Scene Modeling: A Problem-Driven Perspective
April 15, 2026
Auteurs: Weijie Wang, Qihang Cao, Sensen Gao, Donny Y. Chen, Haofei Xu, Wenjing Bian, Songyou Peng, Tat-Jen Cham, Chuanxia Zheng, Andreas Geiger, Jianfei Cai, Jia-Wang Bian, Bohan Zhuang
cs.AI
Résumé
La reconstruction de représentations 3D à partir d'entrées 2D est une tâche fondamentale en vision par ordinateur et en infographie, servant de pierre angulaire pour la compréhension et l'interaction avec le monde physique. Bien que les méthodes traditionnelles atteignent une haute fidélité, elles sont limitées par une optimisation lente par scène ou un entraînement spécifique à une catégorie, ce qui entrave leur déploiement pratique et leur évolutivité. Par conséquent, la reconstruction 3D généralisable par propagation avant a connu un développement rapide ces dernières années. En apprenant un modèle qui mappe directement les images vers des représentations 3D en une seule passe avant, ces méthodes permettent une reconstruction efficace et une généralisation robuste inter-scènes. Notre étude est motivée par une observation cruciale : malgré la diversité des représentations géométriques en sortie, allant des champs implicites aux primitives explicites, les approches par propagation avant existantes partagent des schémas architecturaux de haut niveau similaires, tels que des extracteurs de caractéristiques d'image, des mécanismes de fusion d'informations multi-vues et des principes de conception géométriquement conscients. Par conséquent, nous faisons abstraction de ces différences de représentation pour nous concentrer sur la conception des modèles, en proposant une nouvelle taxonomie centrée sur les stratégies de conception de modèles, indépendantes du format de sortie. Notre taxonomie proposée organise les axes de recherche autour de cinq problèmes clés qui animent les développements récents : l'amélioration des caractéristiques, la conscience géométrique, l'efficacité des modèles, les stratégies d'augmentation et les modèles sensibles au temps. Pour étayer cette taxonomie par des preuves empiriques et une évaluation standardisée, nous passons également en revue de manière exhaustive les benchmarks et jeux de données associés, et discutons et catégorisons largement les applications réelles basées sur les modèles 3D par propagation avant. Enfin, nous esquissons des directions futures pour relever des défis ouverts tels que l'évolutivité, les standards d'évaluation et la modélisation du monde.
English
Reconstructing 3D representations from 2D inputs is a fundamental task in computer vision and graphics, serving as a cornerstone for understanding and interacting with the physical world. While traditional methods achieve high fidelity, they are limited by slow per-scene optimization or category-specific training, which hinders their practical deployment and scalability. Hence, generalizable feed-forward 3D reconstruction has witnessed rapid development in recent years. By learning a model that maps images directly to 3D representations in a single forward pass, these methods enable efficient reconstruction and robust cross-scene generalization. Our survey is motivated by a critical observation: despite the diverse geometric output representations, ranging from implicit fields to explicit primitives, existing feed-forward approaches share similar high-level architectural patterns, such as image feature extraction backbones, multi-view information fusion mechanisms, and geometry-aware design principles. Consequently, we abstract away from these representation differences and instead focus on model design, proposing a novel taxonomy centered on model design strategies that are agnostic to the output format. Our proposed taxonomy organizes the research directions into five key problems that drive recent research development: feature enhancement, geometry awareness, model efficiency, augmentation strategies and temporal-aware models. To support this taxonomy with empirical grounding and standardized evaluation, we further comprehensively review related benchmarks and datasets, and extensively discuss and categorize real-world applications based on feed-forward 3D models. Finally, we outline future directions to address open challenges such as scalability, evaluation standards, and world modeling.