MV-Forcing: Генерация длинных многовидовых видео посредством 4D-обоснованного пространственно-временного самофорсинга
MV-Forcing: Long Multi-View Video Generation via 4D-Grounded Spatio-Temporal Self-Forcing
July 6, 2026
Авторы: Gal Fiebelman, Hadar Averbuch-Elor, Sagie Benaim
cs.AI
Аннотация
Последние достижения в области диффузионных моделей видео позволили реализовать либо длительную генерацию одновидовых последовательностей с помощью темпоральной авторегрессии, либо короткий синтез многовидовых изображений через двунаправленное внимание. Однако создание длинных, непротиворечивых по множеству ракурсов видеороликов динамических сцен остается нерешенной задачей. В данной работе мы представляем MV-Forcing — фреймворк, который объединяет темпоральную и покадровую авторегрессию в рамках одной диффузионной модели путем введения четырехмерного геометрического моста между последовательно генерируемыми видами. Наша ключевая идея заключается в том, что авторегрессионная модель трехмерной реконструкции естественным образом выступает в качестве интерфейса между авторегрессионно создаваемыми видами. Имея готовый исходный вид, мы реконструируем его трехмерную структуру и формируем геометрический априор для следующей целевой точки обзора, который диффузионная модель затем уточняет до высококачественного видео. Чтобы расширить генерацию за пределы фиксированного временного окна учительской модели, мы внедряем совместный режим шумоподавления, при котором оба слота ракурса инициализируются шумом во время обучения, что обеспечивает темпорально неограниченную генерацию. Мы дистиллируем модель с помощью дистилляции согласования распределений (Distribution Matching Distillation) с пространственно-временным самопринуждением (Spatio-Temporal Self-Forcing), устраняя разрыв смещения экспозиции между обучением и выводом как для темпоральной, так и для последовательной по ракурсам авторегрессии. Обширные эксперименты как на синтетических, так и на реальных данных демонстрируют, что MV-Forcing создает геометрически согласованные многовидовые видео динамических сцен произвольной длины и с произвольным числом точек обзора, используя одну малоплаговую студенческую модель.
English
Recent advances in video diffusion models have enabled either long single-view generation through temporal autoregression, or short multi-view synthesis through bidirectional attention. However, generating long, multi-view consistent videos of dynamic scenes remains unsolved. In this work, we present MV-Forcing, a framework that composes temporal and view-wise autoregression within a single diffusion model by introducing a 4D geometric bridge between sequentially generated views. Our key insight is that an autoregressive 3D reconstruction model naturally interfaces between autoregressively generated views. Given a completed source view, we reconstruct its 3D structure and render a geometric prior of the next target viewpoint, which the diffusion model refines into a high-quality video. To extend generation beyond the teacher's fixed temporal window, we introduce a joint denoising regime where both view slots are initialized from noise during training, enabling temporally unbounded generation. We distill the model via Distribution Matching Distillation with Spatio-Temporal Self-Forcing, closing the train-inference exposure bias gap for both temporal and view-sequential autoregression. Extensive experiments on both synthetic and real-world data demonstrate that MV-Forcing produces geometrically consistent multi-view videos of dynamic scenes at arbitrary lengths and viewpoint counts using a single few-step student model.