ChatPaper.aiChatPaper

Flex-Forcing: К единой авторегрессионной и двунаправленной модели диффузии видео

Flex-Forcing: Towards a Unified Autoregressive and Bidirectional Video Diffusion Model

July 3, 2026
Авторы: Xinyin Ma, Julius Berner, Chao Liu, Arash Vahdat, Weili Nie, Xinchao Wang
cs.AI

Аннотация

Недавние достижения в области крупномасштабных генеративных моделей существенно продвинули генерацию видео, однако существующие методы по-прежнему ограничены жёсткой парадигмой вывода. Двунаправленные диффузионные модели превосходно обеспечивают глобальную согласованность и визуальное качество, но страдают от медленного вывода, в то время как авторегрессионные модели обеспечивают эффективную и потоковую генерацию за счёт долгосрочной согласованности и смещения экспозиции. Мы представляем Flex-Forcing — унифицированную структуру обучения и вывода, которая позволяет модели диффузии видео бесшовно работать как в двунаправленном, так и в авторегрессионном режимах генерации. Основная идея — гибкий механизм разбиения на блоки, совместно определяемый по временной оси и шагам шумоподавления. Эта конструкция позволяет модели (1) выполнять гибкое разбиение на блоки в соответствии с различными ограничениями по вычислительным ресурсам, (2) выполнять двунаправленный вывод между блоками для планирования глобальной структуры, одновременно генерируя кадры авторегрессионно внутри каждого блока для эффективного и мелкозернистого синтеза, и (3) выполнять авторегрессионную генерацию в произвольном порядке и на произвольном временном шаге без строгого каузального ограничения. Обширные эксперименты на нескольких эталонах генерации видео показывают, что Flex-Forcing достигает неизменно лучшего качества видео, стабильности длинных видео по сравнению с сильными базовыми моделями с жёстким графиком вывода, при этом обеспечивая более быстрый вывод.
English
Recent progress in large-scale generative models has substantially advanced video generation, yet existing methods remain constrained by a rigid inference paradigm. Bidirectional diffusion models excel at global coherence and visual fidelity but suffer from slow inference, while autoregressive models offer efficient and streaming generation at the cost of long-range consistency and exposure bias. We introduce Flex-Forcing, a unified training and inference framework that enables a video diffusion model to seamlessly operate under both bidirectional and autoregressive generation regimes. The core idea is a flexible chunking mechanism jointly defined over the temporal axis and denoising steps. This design allows the model to (1) perform flexible chunking according to different device budgets, (2) perform bidirectional inference across chunks for global structure planning, while generating frames autoregressively within each chunk for efficient and fine-grained synthesis, and (3) perform any-order, any-timestep autoregressive generation without the strict causal constraint. Extensive experiments on multiple video generation benchmarks demonstrate that Flex-Forcing achieves consistently better video quality, long-video stability than strong baselines with a rigid inference schedule, while offering faster inference.