ChatPaper.aiChatPaper

Image2Sim: Escalando a Navegação Incorporada via Simulador Neural Generativo

Image2Sim: Scaling Embodied Navigation via Generative Neural Simulator

July 7, 2026
Autores: Zihan Wang, Seungjun Lee, Yinghao Xu, Gim Hee Lee
cs.AI

Resumo

Navegação incorporada visa construir agentes que interpretam objetivos multimodais, raciocinam em espaço 3D e alcançam destinos de forma confiável no mundo real. No entanto, o progresso permanece limitado pela falta de ambientes interativos escaláveis, de alta fidelidade e fisicamente fundamentados. Embora conjuntos de dados escaneados do mundo real ofereçam realismo visual, são limitados em escala. Em contraste, simuladores sintéticos são mais facilmente escaláveis, mas frequentemente apresentam grandes lacunas sim-para-real. Apresentamos o Image2Sim, uma estrutura de simulação neural em tempo real que constrói ambientes interativos de alta qualidade a partir de sequências de imagens RGB-D com pose. A ideia central é desacoplar a ancoragem espacial 3D da síntese de observações fotorrealistas. Para a construção da cena, o Image2Sim utiliza um modelo Gaussiano de características feed-forward que eleva observações RGB-D com pose para uma representação Gaussiana de características 3D em uma única passagem. Para a renderização, propomos um modelo de Fluxo de Pixel de Uma Etapa com Ciência Geométrica que transforma projeções Gaussianas esparsas e ruidosas em observações RGB-D panorâmicas de alta qualidade. O Image2Sim também serve como um mecanismo de dados incorporado totalmente automatizado que gera observações de alta fidelidade, ações executáveis e instruções de navegação diversas em escala. Ele converte grandes coleções de vídeos e imagens em quase 20 mil cenas interativas e sintetiza mais de 10 milhões de amostras de treinamento de navegação. Modelos de navegação treinados inteiramente nesses ambientes neurais alcançam melhorias significativas nos principais benchmarks e transferem-se efetivamente para configurações zero-shot no mundo real. Esses resultados sugerem que a simulação neural escalável pode servir como um substrato prático de treinamento para navegação incorporada em larga escala.
English
Embodied navigation aims to build agents that interpret multimodal goals, reason in 3D space, and reach target destinations reliably in the real world. However, progress remains constrained by the lack of scalable, high-fidelity, and physically grounded interactive environments. Although real-world scanned datasets offer visual realism, they are limited by scale. In contrast, synthetic simulators scale more easily but often exhibit large sim-to-real gaps. We introduce Image2Sim, a real-time neural simulation framework that constructs high-quality interactive environments from posed RGB-D image sequences. The central idea is to decouple 3D spatial anchoring from photorealistic observation synthesis. For scene construction, Image2Sim uses a feed-forward feature Gaussian model that lifts posed RGB-D observations into a 3D feature-Gaussian representation in a single pass. For rendering, we propose a Geometry-Aware One-Step Pixel Flow model that transforms sparse and noisy Gaussian projections into high-quality panoramic RGB-D observations. Image2Sim also serves as a fully automated embodied data engine that generates high-fidelity observations, executable actions, and diverse navigation instructions at scale. It converts large collections of videos and images into nearly 20K interactive scenes and synthesizes more than 10 million navigation training samples. Navigation models trained entirely in these neural environments achieve strong improvements on major benchmarks and transfer effectively to real-world zero-shot settings. These results suggest that scalable neural simulation can serve as a practical training substrate for embodied navigation at scale.