Flex-Forcing : Vers un modèle de diffusion vidéo unifié autorégressif et bidirectionnel
Flex-Forcing: Towards a Unified Autoregressive and Bidirectional Video Diffusion Model
July 3, 2026
Auteurs: Xinyin Ma, Julius Berner, Chao Liu, Arash Vahdat, Weili Nie, Xinchao Wang
cs.AI
Résumé
Les récents progrès dans les modèles génératifs à grande échelle ont considérablement amélioré la génération vidéo, mais les méthodes existantes restent contraintes par un paradigme d'inférence rigide. Les modèles de diffusion bidirectionnels excellent en cohérence globale et en fidélité visuelle, mais souffrent d'une inférence lente, tandis que les modèles autorégressifs offrent une génération efficace et en continu au détriment de la cohérence à long terme et du biais d'exposition. Nous introduisons Flex-Forcing, un cadre unifié d'entraînement et d'inférence qui permet à un modèle de diffusion vidéo de fonctionner de manière transparente sous les régimes de génération bidirectionnelle et autorégressive. L'idée centrale est un mécanisme flexible de découpage en blocs, défini conjointement sur l'axe temporel et les étapes de débruitage. Cette conception permet au modèle (1) d'effectuer un découpage flexible en fonction des contraintes matérielles, (2) de réaliser une inférence bidirectionnelle entre les blocs pour une planification globale de la structure, tout en générant les images de manière autorégressive au sein de chaque bloc pour une synthèse efficace et fine, et (3) d'effectuer une génération autorégressive dans n'importe quel ordre et à n'importe quel pas de temps, sans la contrainte stricte de causalité. Des expériences approfondies sur plusieurs benchmarks de génération vidéo montrent que Flex-Forcing atteint une qualité vidéo et une stabilité pour les longues vidéos systématiquement meilleures que les références solides utilisant un schéma d'inférence rigide, tout en offrant une inférence plus rapide.
English
Recent progress in large-scale generative models has substantially advanced video generation, yet existing methods remain constrained by a rigid inference paradigm. Bidirectional diffusion models excel at global coherence and visual fidelity but suffer from slow inference, while autoregressive models offer efficient and streaming generation at the cost of long-range consistency and exposure bias. We introduce Flex-Forcing, a unified training and inference framework that enables a video diffusion model to seamlessly operate under both bidirectional and autoregressive generation regimes. The core idea is a flexible chunking mechanism jointly defined over the temporal axis and denoising steps. This design allows the model to (1) perform flexible chunking according to different device budgets, (2) perform bidirectional inference across chunks for global structure planning, while generating frames autoregressively within each chunk for efficient and fine-grained synthesis, and (3) perform any-order, any-timestep autoregressive generation without the strict causal constraint. Extensive experiments on multiple video generation benchmarks demonstrate that Flex-Forcing achieves consistently better video quality, long-video stability than strong baselines with a rigid inference schedule, while offering faster inference.