ChatPaper.aiChatPaper

Flex-Forcing: Naar een verenigd autoregressief en bidirectioneel videodiffusiemodel

Flex-Forcing: Towards a Unified Autoregressive and Bidirectional Video Diffusion Model

July 3, 2026
Auteurs: Xinyin Ma, Julius Berner, Chao Liu, Arash Vahdat, Weili Nie, Xinchao Wang
cs.AI

Samenvatting

De recente vooruitgang in grootschalige generatieve modellen heeft de videogeneratie aanzienlijk verbeterd, maar bestaande methoden blijven beperkt door een rigide inferentieparadigma. Bidirectionele diffusiemodellen blinken uit in globale coherentie en visuele getrouwheid, maar lijden onder trage inferentie, terwijl autoregressieve modellen efficiënte en gestreamde generatie bieden ten koste van consistentie op lange termijn en exposure bias. We introduceren Flex-Forcing, een uniform trainings- en inferentiekader dat een videodiffusiemodel in staat stelt naadloos te werken onder zowel bidirectionele als autoregressieve generatieregimes. Het kernidee is een flexibel chunkingmechanisme dat gezamenlijk wordt gedefinieerd over de temporele as en de denoisingstappen. Dit ontwerp stelt het model in staat om (1) flexibel chunking uit te voeren volgens verschillende apparaatbudgetten, (2) bidirectionele inferentie over chunks heen uit te voeren voor globale structuurplanning, terwijl het binnen elke chunk frames autoregressief genereert voor efficiënte en fijnmazige synthese, en (3) autoregressieve generatie in elke volgorde en op elke tijdstap uit te voeren zonder de strikte causale beperking. Uitgebreide experimenten op meerdere videogeneratiebenchmarks tonen aan dat Flex-Forcing consistent betere videokwaliteit en stabiliteit voor lange video's behaalt dan sterke baselines met een rigide inferentieschema, terwijl het een snellere inferentie biedt.
English
Recent progress in large-scale generative models has substantially advanced video generation, yet existing methods remain constrained by a rigid inference paradigm. Bidirectional diffusion models excel at global coherence and visual fidelity but suffer from slow inference, while autoregressive models offer efficient and streaming generation at the cost of long-range consistency and exposure bias. We introduce Flex-Forcing, a unified training and inference framework that enables a video diffusion model to seamlessly operate under both bidirectional and autoregressive generation regimes. The core idea is a flexible chunking mechanism jointly defined over the temporal axis and denoising steps. This design allows the model to (1) perform flexible chunking according to different device budgets, (2) perform bidirectional inference across chunks for global structure planning, while generating frames autoregressively within each chunk for efficient and fine-grained synthesis, and (3) perform any-order, any-timestep autoregressive generation without the strict causal constraint. Extensive experiments on multiple video generation benchmarks demonstrate that Flex-Forcing achieves consistently better video quality, long-video stability than strong baselines with a rigid inference schedule, while offering faster inference.