ChatPaper.aiChatPaper

Image2Sim: Escalando la Navegación Encarnada mediante un Simulador Neuronal Generativo

Image2Sim: Scaling Embodied Navigation via Generative Neural Simulator

July 7, 2026
Autores: Zihan Wang, Seungjun Lee, Yinghao Xu, Gim Hee Lee
cs.AI

Resumen

La navegación encarnada tiene como objetivo construir agentes que interpreten metas multimodales, razonen en el espacio 3D y alcancen destinos objetivo de manera confiable en el mundo real. Sin embargo, el progreso sigue estando limitado por la falta de entornos interactivos escalables, de alta fidelidad y físicamente fundamentados. Aunque los conjuntos de datos escaneados del mundo real ofrecen realismo visual, están limitados en escala. En contraste, los simuladores sintéticos escalan más fácilmente, pero a menudo presentan grandes brechas entre simulación y realidad. Presentamos Image2Sim, un marco de simulación neuronal en tiempo real que construye entornos interactivos de alta calidad a partir de secuencias de imágenes RGB-D con pose conocida. La idea central es desacoplar el anclaje espacial 3D de la síntesis de observaciones fotorrealistas. Para la construcción de escenas, Image2Sim utiliza un modelo gaussiano de características feed-forward que transforma observaciones RGB-D con pose en una representación gaussiana de características 3D en una sola pasada. Para el renderizado, proponemos un modelo de flujo de píxeles en un solo paso consciente de la geometría que transforma proyecciones gaussianas dispersas y ruidosas en observaciones RGB-D panorámicas de alta calidad. Image2Sim también sirve como un motor de datos encarnado completamente automatizado que genera observaciones de alta fidelidad, acciones ejecutables e instrucciones de navegación diversas a escala. Convierte grandes colecciones de videos e imágenes en casi 20 mil escenas interactivas y sintetiza más de 10 millones de muestras de entrenamiento para navegación. Los modelos de navegación entrenados completamente en estos entornos neuronales logran mejoras significativas en los principales puntos de referencia y se transfieren de manera efectiva a entornos del mundo real en configuración zero-shot. Estos resultados sugieren que la simulación neuronal escalable puede servir como un sustrato práctico de entrenamiento para la navegación encarnada a gran escala.
English
Embodied navigation aims to build agents that interpret multimodal goals, reason in 3D space, and reach target destinations reliably in the real world. However, progress remains constrained by the lack of scalable, high-fidelity, and physically grounded interactive environments. Although real-world scanned datasets offer visual realism, they are limited by scale. In contrast, synthetic simulators scale more easily but often exhibit large sim-to-real gaps. We introduce Image2Sim, a real-time neural simulation framework that constructs high-quality interactive environments from posed RGB-D image sequences. The central idea is to decouple 3D spatial anchoring from photorealistic observation synthesis. For scene construction, Image2Sim uses a feed-forward feature Gaussian model that lifts posed RGB-D observations into a 3D feature-Gaussian representation in a single pass. For rendering, we propose a Geometry-Aware One-Step Pixel Flow model that transforms sparse and noisy Gaussian projections into high-quality panoramic RGB-D observations. Image2Sim also serves as a fully automated embodied data engine that generates high-fidelity observations, executable actions, and diverse navigation instructions at scale. It converts large collections of videos and images into nearly 20K interactive scenes and synthesizes more than 10 million navigation training samples. Navigation models trained entirely in these neural environments achieve strong improvements on major benchmarks and transfer effectively to real-world zero-shot settings. These results suggest that scalable neural simulation can serve as a practical training substrate for embodied navigation at scale.