ChatPaper.aiChatPaper

Lopend in het Impliciete: Interactieve Wereldverkenning via Neurale Scènerepresentatie

Walking in the Implicit: Interactive World Exploration via Neural Scene Representation

June 29, 2026
Auteurs: Zhiqi Li, Chengrui Dong, Zhenhua Du, Hangning Zhou, Cong Qiu, Hailong Qin, Mu Yang, Dongxu Wei, Peidong Liu
cs.AI

Samenvatting

Interactieve videogeneratiesystemen voor cameragestuurde wereldverkenning rollen groeiende sequenties van latente videoframes uit, waarbij toestandsovergang verstrengeld wordt met hoogfrequente observatiesynthese. Wij stellen Walking in the Implicit voor, een scènegericht paradigma dat de uitrolvariabele verandert van framelatenten naar een vastlange, weergeefbare impliciete toestand, genaamd Neurale Impliciete Scène (NIS). Dit factoriseert interactieve generatie in een stochastische overgang van een compacte scènetoestand en een deterministische pose-afhankelijke weergave, gegeven de gesamplede toestand. We instantiëren dit paradigma als NeuWorld: een transformer-VAE leert lokaal verankerde NIS uit schaars geposeerde frames, en een diffusie-transformer evolueert NIS, geconditioneerd op toekomstige cameratrajecten en geometriebewust opgehaalde geschiedenis. Door de VAE-encoder te hergebruiken als uniforme conditioner, brengt NeuWorld cameracues, referentiebeeldcues en geschiedeniscues in dezelfde NIS-modaliteit, waarbij externe heterogene encoders worden vermeden. NeuWorld, getraind vanaf nul op openbare geposeerde-aanzichten data zonder voorgetrainde videobackbones of hulp-3D-reconstructoren, bereikt sterke lange-termijn consistentie met gunstige inferentie-efficiëntie.
English
Interactive video generation systems for camera-controlled world exploration roll out growing sequences of latent video frames, entangling state transition with high-frequency observation synthesis. We propose Walking in the Implicit, a scene-centric paradigm that changes the rollout variable from frame latents to a fixed-length, renderable implicit state, termed Neural Implicit Scene (NIS). This factorizes interactive generation into stochastic transition of a compact scene state and deterministic pose-conditioned rendering given the sampled state. We instantiate this paradigm as NeuWorld: a transformer VAE learns locally anchored NIS from sparse posed frames, and a diffusion transformer evolves NIS conditioned on future camera trajectories and geometry-aware retrieved history. By reusing the VAE encoder as a unified conditioner, NeuWorld maps camera, reference-image, and history cues into the same NIS modality, avoiding external heterogeneous encoders. Trained from scratch on public posed-view data without pretrained video backbones or auxiliary 3D reconstructors, NeuWorld achieves strong long-horizon consistency with favorable inference efficiency.