MV-Forcing: Lange multi-view videogeneratie via 4D-gegronde ruimtelijk-temporele zelf-forcing
MV-Forcing: Long Multi-View Video Generation via 4D-Grounded Spatio-Temporal Self-Forcing
July 6, 2026
Auteurs: Gal Fiebelman, Hadar Averbuch-Elor, Sagie Benaim
cs.AI
Samenvatting
Recente vooruitgang in videodiffusiemodellen heeft het mogelijk gemaakt om ofwel lange enkelvoudige aanzichtgeneratie via temporele autoregressie, ofwel korte meervoudige aanzicht-synthese via bidirectionele aandacht te realiseren. Het genereren van lange, meervoudige aanzicht-consistente video's van dynamische scènes blijft echter onopgelost. In dit werk presenteren we MV-Forcing, een raamwerk dat temporele en aanzichtgewijze autoregressie binnen één diffusiemodel combineert door een 4D-geometrische brug te introduceren tussen sequentieel gegenereerde aanzichten. Ons belangrijkste inzicht is dat een autoregressief 3D-reconstructiemodel naadloos aansluit tussen autoregressief gegenereerde aanzichten. Gegeven een voltooid bronaanzicht reconstrueren we de 3D-structuur ervan en renderen we een geometrische voorkennis van het volgende doelstandpunt, die het diffusiemodel verfijnt tot een hoogwaardige video. Om de generatie uit te breiden voorbij het vaste temporele venster van het leraarmodel, introduceren we een gezamenlijk ontruisingsregime waarbij beide aanzichtsleuven tijdens de training vanuit ruis worden geïnitialiseerd, wat temporeel onbegrensde generatie mogelijk maakt. We destilleren het model via Distributiematching-destillatie met Ruimtelijk-Temporele Zelfdwinging, waarmee de kloof in blootstellingsbias tussen training en inferentie wordt gedicht voor zowel temporele als aanzichtsequentiële autoregressie. Uitgebreide experimenten op zowel gesynthetiseerde als echte data tonen aan dat MV-Forcing geometrisch consistente meervoudige aanzichtvideo's van dynamische scènes produceert met willekeurige lengtes en aantal standpunten, met behulp van één enkel studentmodel met weinig stappen.
English
Recent advances in video diffusion models have enabled either long single-view generation through temporal autoregression, or short multi-view synthesis through bidirectional attention. However, generating long, multi-view consistent videos of dynamic scenes remains unsolved. In this work, we present MV-Forcing, a framework that composes temporal and view-wise autoregression within a single diffusion model by introducing a 4D geometric bridge between sequentially generated views. Our key insight is that an autoregressive 3D reconstruction model naturally interfaces between autoregressively generated views. Given a completed source view, we reconstruct its 3D structure and render a geometric prior of the next target viewpoint, which the diffusion model refines into a high-quality video. To extend generation beyond the teacher's fixed temporal window, we introduce a joint denoising regime where both view slots are initialized from noise during training, enabling temporally unbounded generation. We distill the model via Distribution Matching Distillation with Spatio-Temporal Self-Forcing, closing the train-inference exposure bias gap for both temporal and view-sequential autoregression. Extensive experiments on both synthetic and real-world data demonstrate that MV-Forcing produces geometrically consistent multi-view videos of dynamic scenes at arbitrary lengths and viewpoint counts using a single few-step student model.