ChatPaper.aiChatPaper

Image2Sim: Het opschalen van belichaamde navigatie via een generatieve neurale simulator

Image2Sim: Scaling Embodied Navigation via Generative Neural Simulator

July 7, 2026
Auteurs: Zihan Wang, Seungjun Lee, Yinghao Xu, Gim Hee Lee
cs.AI

Samenvatting

Embodied navigation streeft ernaar agenten te bouwen die multimodale doelen interpreteren, in 3D-ruimte redeneren en betrouwbaar doelbestemmingen in de echte wereld bereiken. De vooruitgang wordt echter beperkt door het gebrek aan schaalbare, hoogwaardige en fysiek verankerde interactieve omgevingen. Hoewel gescande datasets uit de echte wereld visueel realisme bieden, worden ze beperkt door schaal. Synthetische simulatoren daarentegen zijn eenvoudiger schaalbaar, maar vertonen vaak grote sim-to-real hiaten. We introduceren Image2Sim, een real-time neuraal simulatiekader dat hoogwaardige interactieve omgevingen construeert uit geposeerde RGB-D-beeldreeksen. Het centrale idee is om 3D-ruimtelijke verankering te ontkoppelen van fotorealistische observatiesynthese. Voor scenoconstructie gebruikt Image2Sim een feed-forward feature-Gaussiaans model dat geposeerde RGB-D-observaties in één enkele doorgang omzet in een 3D-feature-Gaussiaanse representatie. Voor rendering stellen we een Geometry-Aware One-Step Pixel Flow-model voor dat schaarse en ruizige Gaussiaanse projecties transformeert in hoogwaardige panoramische RGB-D-observaties. Image2Sim dient ook als een volledig geautomatiseerde embodied data-engine die op schaal hoogwaardige observaties, uitvoerbare acties en uiteenlopende navigatie-instructies genereert. Het zet grote verzamelingen video's en afbeeldingen om in bijna 20K interactieve scènes en synthetiseert meer dan 10 miljoen navigatietrainingsvoorbeelden. Navigatiemodellen die volledig in deze neurale omgevingen zijn getraind, behalen sterke verbeteringen op belangrijke benchmarks en worden effectief overgedragen naar zero-shot-instellingen in de echte wereld. Deze resultaten suggereren dat schaalbare neurale simulatie kan dienen als een praktisch trainingssubstraat voor embodied navigation op schaal.
English
Embodied navigation aims to build agents that interpret multimodal goals, reason in 3D space, and reach target destinations reliably in the real world. However, progress remains constrained by the lack of scalable, high-fidelity, and physically grounded interactive environments. Although real-world scanned datasets offer visual realism, they are limited by scale. In contrast, synthetic simulators scale more easily but often exhibit large sim-to-real gaps. We introduce Image2Sim, a real-time neural simulation framework that constructs high-quality interactive environments from posed RGB-D image sequences. The central idea is to decouple 3D spatial anchoring from photorealistic observation synthesis. For scene construction, Image2Sim uses a feed-forward feature Gaussian model that lifts posed RGB-D observations into a 3D feature-Gaussian representation in a single pass. For rendering, we propose a Geometry-Aware One-Step Pixel Flow model that transforms sparse and noisy Gaussian projections into high-quality panoramic RGB-D observations. Image2Sim also serves as a fully automated embodied data engine that generates high-fidelity observations, executable actions, and diverse navigation instructions at scale. It converts large collections of videos and images into nearly 20K interactive scenes and synthesizes more than 10 million navigation training samples. Navigation models trained entirely in these neural environments achieve strong improvements on major benchmarks and transfer effectively to real-world zero-shot settings. These results suggest that scalable neural simulation can serve as a practical training substrate for embodied navigation at scale.