ChatPaper.aiChatPaper

Image2Sim: масштабирование воплощенной навигации с помощью генеративного нейронного симулятора

Image2Sim: Scaling Embodied Navigation via Generative Neural Simulator

July 7, 2026
Авторы: Zihan Wang, Seungjun Lee, Yinghao Xu, Gim Hee Lee
cs.AI

Аннотация

Воплощенная навигация направлена на создание агентов, которые интерпретируют мультимодальные цели, рассуждают в трехмерном пространстве и надежно достигают целевых пунктов назначения в реальном мире. Однако прогресс остается ограниченным из-за отсутствия масштабируемых, высокоточных и физически обоснованных интерактивных сред. Хотя сканированные наборы данных реального мира обеспечивают визуальную реалистичность, они ограничены по масштабу. Напротив, синтетические симуляторы легче масштабируются, но часто демонстрируют большие разрывы между симуляцией и реальностью. Мы представляем Image2Sim — фреймворк нейронной симуляции в реальном времени, который создает высококачественные интерактивные среды из последовательностей RGB-D изображений с известными позами. Центральная идея заключается в разделении трехмерной пространственной привязки и синтеза фотореалистичных наблюдений. Для построения сцен Image2Sim использует прямую модель гауссианов признаков, которая за один проход преобразует RGB-D наблюдения с известными позами в трехмерное представление гауссианов признаков. Для рендеринга мы предлагаем модель однократного потока пикселей с учетом геометрии, которая преобразует разреженные и зашумленные проекции гауссианов в высококачественные панорамные RGB-D наблюдения. Image2Sim также служит полностью автоматизированным воплощенным движком данных, который генерирует высокоточные наблюдения, выполнимые действия и разнообразные инструкции по навигации в масштабе. Он преобразует большие коллекции видео и изображений в почти 20 тысяч интерактивных сцен и синтезирует более 10 миллионов обучающих примеров для навигации. Модели навигации, обученные исключительно в этих нейронных средах, достигают значительных улучшений на основных эталонных тестах и эффективно переносятся в реальные условия без дополнительного обучения. Эти результаты показывают, что масштабируемая нейронная симуляция может служить практической основой для тренировки воплощенной навигации в больших масштабах.
English
Embodied navigation aims to build agents that interpret multimodal goals, reason in 3D space, and reach target destinations reliably in the real world. However, progress remains constrained by the lack of scalable, high-fidelity, and physically grounded interactive environments. Although real-world scanned datasets offer visual realism, they are limited by scale. In contrast, synthetic simulators scale more easily but often exhibit large sim-to-real gaps. We introduce Image2Sim, a real-time neural simulation framework that constructs high-quality interactive environments from posed RGB-D image sequences. The central idea is to decouple 3D spatial anchoring from photorealistic observation synthesis. For scene construction, Image2Sim uses a feed-forward feature Gaussian model that lifts posed RGB-D observations into a 3D feature-Gaussian representation in a single pass. For rendering, we propose a Geometry-Aware One-Step Pixel Flow model that transforms sparse and noisy Gaussian projections into high-quality panoramic RGB-D observations. Image2Sim also serves as a fully automated embodied data engine that generates high-fidelity observations, executable actions, and diverse navigation instructions at scale. It converts large collections of videos and images into nearly 20K interactive scenes and synthesizes more than 10 million navigation training samples. Navigation models trained entirely in these neural environments achieve strong improvements on major benchmarks and transfer effectively to real-world zero-shot settings. These results suggest that scalable neural simulation can serve as a practical training substrate for embodied navigation at scale.