ChatPaper.aiChatPaper

Flex-Forcing: Rumo a um Modelo Unificado de Difusão de Vídeo Autoregressivo e Bidirecional

Flex-Forcing: Towards a Unified Autoregressive and Bidirectional Video Diffusion Model

July 3, 2026
Autores: Xinyin Ma, Julius Berner, Chao Liu, Arash Vahdat, Weili Nie, Xinchao Wang
cs.AI

Resumo

O progresso recente em modelos generativos de grande escala avançou substancialmente a geração de vídeos, porém os métodos existentes ainda estão limitados por um paradigma de inferência rígido. Modelos de difusão bidirecionais destacam-se pela coerência global e fidelidade visual, mas sofrem com inferência lenta, enquanto modelos autorregressivos oferecem geração eficiente e em fluxo contínuo ao custo de consistência de longo alcance e viés de exposição. Apresentamos o Flex-Forcing, uma estrutura unificada de treinamento e inferência que permite que um modelo de difusão de vídeo opere perfeitamente sob regimes de geração bidirecional e autorregressiva. A ideia central é um mecanismo flexível de fragmentação, definido conjuntamente sobre o eixo temporal e as etapas de remoção de ruído. Esse design permite que o modelo: (1) realize fragmentação flexível de acordo com diferentes orçamentos de dispositivo; (2) execute inferência bidirecional entre fragmentos para planejamento estrutural global, enquanto gera quadros de forma autorregressiva dentro de cada fragmento para síntese eficiente e de granularidade fina; e (3) realize geração autorregressiva de qualquer ordem e qualquer etapa temporal, sem a restrição causal estrita. Experimentos extensivos em múltiplos benchmarks de geração de vídeo demonstram que o Flex-Forcing alcança consistentemente qualidade de vídeo e estabilidade em vídeos longos superiores às linhas de base fortes com cronograma de inferência rígido, além de oferecer inferência mais rápida.
English
Recent progress in large-scale generative models has substantially advanced video generation, yet existing methods remain constrained by a rigid inference paradigm. Bidirectional diffusion models excel at global coherence and visual fidelity but suffer from slow inference, while autoregressive models offer efficient and streaming generation at the cost of long-range consistency and exposure bias. We introduce Flex-Forcing, a unified training and inference framework that enables a video diffusion model to seamlessly operate under both bidirectional and autoregressive generation regimes. The core idea is a flexible chunking mechanism jointly defined over the temporal axis and denoising steps. This design allows the model to (1) perform flexible chunking according to different device budgets, (2) perform bidirectional inference across chunks for global structure planning, while generating frames autoregressively within each chunk for efficient and fine-grained synthesis, and (3) perform any-order, any-timestep autoregressive generation without the strict causal constraint. Extensive experiments on multiple video generation benchmarks demonstrate that Flex-Forcing achieves consistently better video quality, long-video stability than strong baselines with a rigid inference schedule, while offering faster inference.