ChatPaper.aiChatPaper

MV-Forcing : Génération de vidéos multi-vues longues via un auto-forçage spatio-temporel ancré en 4D

MV-Forcing: Long Multi-View Video Generation via 4D-Grounded Spatio-Temporal Self-Forcing

July 6, 2026
Auteurs: Gal Fiebelman, Hadar Averbuch-Elor, Sagie Benaim
cs.AI

Résumé

Les avancées récentes dans les modèles de diffusion vidéo ont permis soit la génération longue en vue unique via l'autorégression temporelle, soit la synthèse courte multi-vue via l'attention bidirectionnelle. Cependant, la génération de vidéos longues, multi-vues et géométriquement cohérentes de scènes dynamiques reste non résolue. Dans ce travail, nous présentons MV-Forcing, un cadre qui compose l'autorégression temporelle et par point de vue au sein d'un seul modèle de diffusion en introduisant un pont géométrique 4D entre les vues générées séquentiellement. Notre idée clé est qu'un modèle de reconstruction 3D autorégressif s'interf ace naturellement entre les vues générées autorégressivement. Étant donné une vue source complétée, nous reconstruisons sa structure 3D et rendons un prior géométrique du prochain point de vue cible, que le modèle de diffusion affine en une vidéo de haute qualité. Pour étendre la génération au-delà de la fenêtre temporelle fixe du professeur, nous introduisons un régime de débruitage conjoint où les deux emplacements de vue sont initialisés à partir du bruit pendant l'entraînement, permettant une génération temporellement illimitée. Nous distillons le modèle via la Distillation par Appariement de Distribution avec Auto-Forcing Spatio-Temporel, comblant ainsi l'écart de biais d'exposition entraînement-inférence pour l'autorégression à la fois temporelle et séquentielle par point de vue. Des expériences approfondies sur des données synthétiques et réelles démontrent que MV-Forcing produit des vidéos multi-vues géométriquement cohérentes de scènes dynamiques à des longueurs et des nombres de points de vue arbitraires en utilisant un seul modèle étudiant à quelques étapes.
English
Recent advances in video diffusion models have enabled either long single-view generation through temporal autoregression, or short multi-view synthesis through bidirectional attention. However, generating long, multi-view consistent videos of dynamic scenes remains unsolved. In this work, we present MV-Forcing, a framework that composes temporal and view-wise autoregression within a single diffusion model by introducing a 4D geometric bridge between sequentially generated views. Our key insight is that an autoregressive 3D reconstruction model naturally interfaces between autoregressively generated views. Given a completed source view, we reconstruct its 3D structure and render a geometric prior of the next target viewpoint, which the diffusion model refines into a high-quality video. To extend generation beyond the teacher's fixed temporal window, we introduce a joint denoising regime where both view slots are initialized from noise during training, enabling temporally unbounded generation. We distill the model via Distribution Matching Distillation with Spatio-Temporal Self-Forcing, closing the train-inference exposure bias gap for both temporal and view-sequential autoregression. Extensive experiments on both synthetic and real-world data demonstrate that MV-Forcing produces geometrically consistent multi-view videos of dynamic scenes at arbitrary lengths and viewpoint counts using a single few-step student model.