ChatPaper.aiChatPaper

CineMobile: Диффузия изображения в видео на устройстве для генерации кинематографических движений камеры

CineMobile: On-Device Image-to-Video Diffusion for Cinematic Camera Motion Generation

July 4, 2026
Авторы: Xuyao Huang, Zelai Deng, Xu Wang, Xizhong Xiao, Zhijie Deng
cs.AI

Аннотация

Растущий спрос на создание видео из изображений на мобильных устройствах все больше фокусируется на кинематографических эффектах движения, таких как «bullet time», наезд/отъезд камеры (dolly zoom), замедленная съемка и другие. Хотя диффузионные трансформеры (DiT) демонстрируют высокую производительность в генерации видео, их большой объем параметров и многошаговый итеративный процесс шумоподавления приводят к значительным вычислительным затратам, что затрудняет эффективную генерацию на мобильных устройствах. Мы предлагаем CineMobile для преодоления этого разрыва. В частности, CineMobile использует трехкомпонентную стратегию оптимизации: (1) применение дистилляции с направленным прунингом для получения компактной, но эффективной модели, сохраняющей основные возможности генерации видео, необходимые для кинематографических эффектов; (2) оптимизация сжатой модели в 4-шаговый генератор с помощью комбинации диффузионной дистилляции и обучения с подкреплением; (3) использование гибридного квантования после обучения для сжатия размера модели до менее 1 ГБ. Экспериментальные результаты показывают, что по сравнению с моделью-учителем на архитектуре Wan 2.1 CineMobile достигает ускорения генерации в 40 раз при сохранении сопоставимого визуального качества. В частности, CineMobile генерирует видео 480p из 49 кадров с задержкой шумоподавления на шаг 0,6 секунды на графическом процессоре NVIDIA H200 и 20 секунд на платформе MediaTek Dimensity 8400 Ultimate 5G, при пиковом использовании памяти 1,8 ГБ, что демонстрирует его практическую применимость для создания видео из изображений на мобильных устройствах.
English
The growing demand for image-to-video creation on mobile devices has increasingly focused on cinematic motion effects like bullet time, dolly zoom, slow motion, etc. While Diffusion Transformers (DiTs) exhibit strong performance in video generation, their large parameter sizes and multi-step iterative denoising processes lead to substantial computational overhead, making efficient generation on mobile devices challenging. We propose CineMobile to bridge the gap. In particular, CineMobile adopts a three-fold optimization strategy: (1) leveraging a distillation-guided pruning approach to derive a compact yet efficient model that retains the essential video generation capabilities required for cinematic effects; (2) optimizing the compressed model into a 4-step generator via a combination of diffusion distillation and reinforcement learning; (3) employing a hybrid post-training quantization strategy to compress the model footprint to under 1 GB. Experimental results show that compared to the teacher model with the Wan 2.1 architecture, CineMobile achieves a 40x speedup in generation while maintaining comparable visual quality. Specifically, CineMobile generates 49-frame 480p videos with a per-step denoising latency of 0.6s on an NVIDIA H200 GPU and 20s on the MediaTek Dimensity 8400 Ultimate 5G platform, with a peak memory usage of 1.8 GB, demonstrating its practical applicability for mobile-based image-to-video creation.