Image2Sim : Mise à l'échelle de la navigation incarnée via un simulateur neuronal génératif
Image2Sim: Scaling Embodied Navigation via Generative Neural Simulator
July 7, 2026
Auteurs: Zihan Wang, Seungjun Lee, Yinghao Xu, Gim Hee Lee
cs.AI
Résumé
La navigation incarnée vise à construire des agents capables d'interpréter des objectifs multimodaux, de raisonner dans l'espace 3D et d'atteindre des destinations cibles de manière fiable dans le monde réel. Cependant, les progrès restent limités par le manque d'environnements interactifs extensibles, à haute fidélité et physiquement fondés. Bien que les ensembles de données numérisées du monde réel offrent un réalisme visuel, leur échelle est limitée. En revanche, les simulateurs synthétiques passent à l'échelle plus facilement, mais présentent souvent des écarts importants entre simulation et réalité. Nous présentons Image2Sim, un cadre de simulation neuronale en temps réel qui construit des environnements interactifs de haute qualité à partir de séquences d'images RVB-D posées. L'idée centrale consiste à découpler l'ancrage spatial 3D de la synthèse d'observations photoréalistes. Pour la construction de scènes, Image2Sim utilise un modèle de Gaussienne de caractéristiques par propagation avant qui transforme les observations RVB-D posées en une représentation 3D de Gaussienne de caractéristiques en un seul passage. Pour le rendu, nous proposons un modèle de Flux de Pixels en une étape sensible à la géométrie qui transforme des projections de Gaussiennes clairsemées et bruitées en observations RVB-D panoramiques de haute qualité. Image2Sim sert également de moteur de données incarné entièrement automatisé qui génère à grande échelle des observations haute fidélité, des actions exécutables et des instructions de navigation variées. Il convertit de grandes collections de vidéos et d'images en près de 20 000 scènes interactives et synthétise plus de 10 millions d'échantillons d'apprentissage de navigation. Les modèles de navigation entièrement entraînés dans ces environnements neuronaux obtiennent des améliorations significatives sur les principaux benchmarks et se transfèrent efficacement à des configurations zero-shot réelles. Ces résultats suggèrent que la simulation neuronale extensible peut servir de substrat pratique d'entraînement pour la navigation incarnée à grande échelle.
English
Embodied navigation aims to build agents that interpret multimodal goals, reason in 3D space, and reach target destinations reliably in the real world. However, progress remains constrained by the lack of scalable, high-fidelity, and physically grounded interactive environments. Although real-world scanned datasets offer visual realism, they are limited by scale. In contrast, synthetic simulators scale more easily but often exhibit large sim-to-real gaps. We introduce Image2Sim, a real-time neural simulation framework that constructs high-quality interactive environments from posed RGB-D image sequences. The central idea is to decouple 3D spatial anchoring from photorealistic observation synthesis. For scene construction, Image2Sim uses a feed-forward feature Gaussian model that lifts posed RGB-D observations into a 3D feature-Gaussian representation in a single pass. For rendering, we propose a Geometry-Aware One-Step Pixel Flow model that transforms sparse and noisy Gaussian projections into high-quality panoramic RGB-D observations. Image2Sim also serves as a fully automated embodied data engine that generates high-fidelity observations, executable actions, and diverse navigation instructions at scale. It converts large collections of videos and images into nearly 20K interactive scenes and synthesizes more than 10 million navigation training samples. Navigation models trained entirely in these neural environments achieve strong improvements on major benchmarks and transfer effectively to real-world zero-shot settings. These results suggest that scalable neural simulation can serve as a practical training substrate for embodied navigation at scale.