ChatPaper.aiChatPaper

MV-Forcing: Geração de Vídeos Multi-View Longos via Auto-Forçamento Espaço-Temporal Fundamentado em 4D

MV-Forcing: Long Multi-View Video Generation via 4D-Grounded Spatio-Temporal Self-Forcing

July 6, 2026
Autores: Gal Fiebelman, Hadar Averbuch-Elor, Sagie Benaim
cs.AI

Resumo

Avanços recentes em modelos de difusão de vídeo permitiram tanto a geração longa de vista única por meio de autoregressão temporal quanto a síntese curta multivista por meio de atenção bidirecional. No entanto, gerar vídeos longos e multivista geometricamente consistentes de cenas dinâmicas permanece um problema em aberto. Neste trabalho, apresentamos o MV-Forcing, um arcabouço que compõe autoregressão temporal e por vista em um único modelo de difusão, introduzindo uma ponte geométrica 4D entre vistas geradas sequencialmente. Nossa percepção chave é que um modelo de reconstrução 3D autoregressivo naturalmente faz a interface entre vistas geradas autoregressivamente. Dada uma vista fonte completa, reconstruímos sua estrutura 3D e renderizamos uma priori geométrica do próximo ponto de vista alvo, que o modelo de difusão refina em um vídeo de alta qualidade. Para estender a geração além da janela temporal fixa do professor, introduzimos um regime conjunto de denoising onde ambos os espaços de vista são inicializados a partir de ruído durante o treinamento, permitindo geração temporalmente ilimitada. Destilamos o modelo por meio de Destilação por Correspondência de Distribuição com Auto-Forçamento Espaço-Temporal, fechando a lacuna de viés de exposição treino-inferência tanto para autoregressão temporal quanto para a sequencial de vistas. Experimentos extensivos em dados sintéticos e do mundo real demonstram que o MV-Forcing produz vídeos multivista geometricamente consistentes de cenas dinâmicas em comprimentos e contagens de pontos de vista arbitrários usando um único modelo estudante de poucos passos.
English
Recent advances in video diffusion models have enabled either long single-view generation through temporal autoregression, or short multi-view synthesis through bidirectional attention. However, generating long, multi-view consistent videos of dynamic scenes remains unsolved. In this work, we present MV-Forcing, a framework that composes temporal and view-wise autoregression within a single diffusion model by introducing a 4D geometric bridge between sequentially generated views. Our key insight is that an autoregressive 3D reconstruction model naturally interfaces between autoregressively generated views. Given a completed source view, we reconstruct its 3D structure and render a geometric prior of the next target viewpoint, which the diffusion model refines into a high-quality video. To extend generation beyond the teacher's fixed temporal window, we introduce a joint denoising regime where both view slots are initialized from noise during training, enabling temporally unbounded generation. We distill the model via Distribution Matching Distillation with Spatio-Temporal Self-Forcing, closing the train-inference exposure bias gap for both temporal and view-sequential autoregression. Extensive experiments on both synthetic and real-world data demonstrate that MV-Forcing produces geometrically consistent multi-view videos of dynamic scenes at arbitrary lengths and viewpoint counts using a single few-step student model.