ChatPaper.aiChatPaper

Flex-Forcing: Hacia un Modelo de Difusión de Video Autoregresivo y Bidireccional Unificado

Flex-Forcing: Towards a Unified Autoregressive and Bidirectional Video Diffusion Model

July 3, 2026
Autores: Xinyin Ma, Julius Berner, Chao Liu, Arash Vahdat, Weili Nie, Xinchao Wang
cs.AI

Resumen

El progreso reciente en modelos generativos a gran escala ha avanzado sustancialmente la generación de video, pero los métodos existentes siguen limitados por un paradigma de inferencia rígido. Los modelos de difusión bidireccionales destacan en coherencia global y fidelidad visual, pero sufren de inferencia lenta, mientras que los modelos autorregresivos ofrecen generación eficiente y en streaming a costa de la consistencia de largo alcance y el sesgo de exposición. Presentamos Flex-Forcing, un marco unificado de entrenamiento e inferencia que permite a un modelo de difusión de video operar de manera fluida tanto en regímenes de generación bidireccional como autorregresiva. La idea central es un mecanismo flexible de segmentación definido conjuntamente sobre el eje temporal y los pasos de eliminación de ruido. Este diseño permite al modelo (1) realizar una segmentación flexible según diferentes presupuestos de dispositivo, (2) realizar inferencia bidireccional entre segmentos para la planificación global de la estructura, mientras genera fotogramas de forma autorregresiva dentro de cada segmento para una síntesis eficiente y detallada, y (3) realizar generación autorregresiva en cualquier orden y en cualquier paso temporal sin la estricta restricción causal. Amplios experimentos en múltiples puntos de referencia de generación de video demuestran que Flex-Forcing logra consistentemente una mejor calidad de video y estabilidad en videos largos en comparación con líneas base sólidas con un programa de inferencia rígido, al tiempo que ofrece una inferencia más rápida.
English
Recent progress in large-scale generative models has substantially advanced video generation, yet existing methods remain constrained by a rigid inference paradigm. Bidirectional diffusion models excel at global coherence and visual fidelity but suffer from slow inference, while autoregressive models offer efficient and streaming generation at the cost of long-range consistency and exposure bias. We introduce Flex-Forcing, a unified training and inference framework that enables a video diffusion model to seamlessly operate under both bidirectional and autoregressive generation regimes. The core idea is a flexible chunking mechanism jointly defined over the temporal axis and denoising steps. This design allows the model to (1) perform flexible chunking according to different device budgets, (2) perform bidirectional inference across chunks for global structure planning, while generating frames autoregressively within each chunk for efficient and fine-grained synthesis, and (3) perform any-order, any-timestep autoregressive generation without the strict causal constraint. Extensive experiments on multiple video generation benchmarks demonstrate that Flex-Forcing achieves consistently better video quality, long-video stability than strong baselines with a rigid inference schedule, while offering faster inference.