ChatPaper.aiChatPaper

Caminhando no Implícito: exploração interativa do mundo via representação neural de cenas

Walking in the Implicit: Interactive World Exploration via Neural Scene Representation

June 29, 2026
Autores: Zhiqi Li, Chengrui Dong, Zhenhua Du, Hangning Zhou, Cong Qiu, Hailong Qin, Mu Yang, Dongxu Wei, Peidong Liu
cs.AI

Resumo

Sistemas interativos de geração de vídeo para exploração de mundos controlados por câmera produzem sequências crescentes de quadros latentes de vídeo, entrelaçando a transição de estado com a síntese de observação de alta frequência. Propomos o Caminhar no Implícito, um paradigma centrado na cena que altera a variável de rollout de latentes de quadros para um estado implícito de comprimento fixo e renderizável, denominado Cena Neural Implícita (NIS). Isso fatora a geração interativa em transição estocástica de um estado de cena compacto e renderização determinística condicionada à pose, dado o estado amostrado. Instanciamos este paradigma como NeuWorld: um VAE transformer aprende NIS localmente ancoradas a partir de quadros esparsos com pose, e um transformer de difusão evolui a NIS condicionada a trajetórias futuras da câmera e a histórico recuperado com noção geométrica. Reutilizando o codificador do VAE como um condicionador unificado, o NeuWorld mapeia pistas da câmera, imagens de referência e histórico para a mesma modalidade NIS, evitando codificadores externos heterogêneos. Treinado do zero em dados públicos de visão com pose, sem backbones de vídeo pré-treinados ou reconstrutores 3D auxiliares, o NeuWorld alcança forte consistência de longo horizonte com eficiência de inferência favorável.
English
Interactive video generation systems for camera-controlled world exploration roll out growing sequences of latent video frames, entangling state transition with high-frequency observation synthesis. We propose Walking in the Implicit, a scene-centric paradigm that changes the rollout variable from frame latents to a fixed-length, renderable implicit state, termed Neural Implicit Scene (NIS). This factorizes interactive generation into stochastic transition of a compact scene state and deterministic pose-conditioned rendering given the sampled state. We instantiate this paradigm as NeuWorld: a transformer VAE learns locally anchored NIS from sparse posed frames, and a diffusion transformer evolves NIS conditioned on future camera trajectories and geometry-aware retrieved history. By reusing the VAE encoder as a unified conditioner, NeuWorld maps camera, reference-image, and history cues into the same NIS modality, avoiding external heterogeneous encoders. Trained from scratch on public posed-view data without pretrained video backbones or auxiliary 3D reconstructors, NeuWorld achieves strong long-horizon consistency with favorable inference efficiency.