ChatPaper.aiChatPaper

MV-Forcing: Generación de Videos Multivista Largos mediante Auto-Forzamiento Espacio-Temporal Basado en 4D

MV-Forcing: Long Multi-View Video Generation via 4D-Grounded Spatio-Temporal Self-Forcing

July 6, 2026
Autores: Gal Fiebelman, Hadar Averbuch-Elor, Sagie Benaim
cs.AI

Resumen

Los avances recientes en modelos de difusión de video han permitido la generación de planos secuencia largos mediante autoregresión temporal, o la síntesis multivista corta mediante atención bidireccional. Sin embargo, la generación de videos multivista largos y geométricamente coherentes de escenas dinámicas sigue sin resolverse. En este trabajo presentamos MV-Forcing, un marco que compone la autoregresión temporal y por vista dentro de un único modelo de difusión mediante la introducción de un puente geométrico 4D entre vistas generadas secuencialmente. Nuestra idea clave es que un modelo de reconstrucción 3D autoregresivo actúa como interfaz natural entre vistas generadas de forma autoregresiva. Dada una vista fuente completa, reconstruimos su estructura 3D y generamos un prior geométrico del siguiente punto de vista objetivo, que el modelo de difusión refina para convertirlo en un video de alta calidad. Para extender la generación más allá de la ventana temporal fija del maestro, introducimos un régimen de eliminación conjunta de ruido en el que ambas ranuras de vista se inicializan a partir de ruido durante el entrenamiento, lo que permite una generación temporalmente ilimitada. Destilamos el modelo mediante Destilación por Emparejamiento de Distribuciones con Auto-Forzamiento Espacio-Temporal, cerrando la brecha de sesgo de exposición entre entrenamiento e inferencia tanto para la autoregresión temporal como para la secuencial por vistas. Experimentos exhaustivos tanto en datos sintéticos como reales demuestran que MV-Forcing produce videos multivista geométricamente coherentes de escenas dinámicas en longitudes y cantidades de puntos de vista arbitrarias utilizando un único modelo estudiante de pocos pasos.
English
Recent advances in video diffusion models have enabled either long single-view generation through temporal autoregression, or short multi-view synthesis through bidirectional attention. However, generating long, multi-view consistent videos of dynamic scenes remains unsolved. In this work, we present MV-Forcing, a framework that composes temporal and view-wise autoregression within a single diffusion model by introducing a 4D geometric bridge between sequentially generated views. Our key insight is that an autoregressive 3D reconstruction model naturally interfaces between autoregressively generated views. Given a completed source view, we reconstruct its 3D structure and render a geometric prior of the next target viewpoint, which the diffusion model refines into a high-quality video. To extend generation beyond the teacher's fixed temporal window, we introduce a joint denoising regime where both view slots are initialized from noise during training, enabling temporally unbounded generation. We distill the model via Distribution Matching Distillation with Spatio-Temporal Self-Forcing, closing the train-inference exposure bias gap for both temporal and view-sequential autoregression. Extensive experiments on both synthetic and real-world data demonstrate that MV-Forcing produces geometrically consistent multi-view videos of dynamic scenes at arbitrary lengths and viewpoint counts using a single few-step student model.