CineMobile: Difusión de imagen a video en el dispositivo para la generación de movimiento cinematográfico de cámara
CineMobile: On-Device Image-to-Video Diffusion for Cinematic Camera Motion Generation
July 4, 2026
Autores: Xuyao Huang, Zelai Deng, Xu Wang, Xizhong Xiao, Zhijie Deng
cs.AI
Resumen
La creciente demanda de creación de imagen a video en dispositivos móviles se ha centrado cada vez más en efectos cinematográficos de movimiento como el tiempo bala, el zoom tipo dolly, la cámara lenta, entre otros. Si bien los Transformers de Difusión (DiTs) muestran un rendimiento sólido en la generación de videos, su gran tamaño de parámetros y los procesos iterativos de eliminación de ruido en múltiples pasos generan una sobrecarga computacional considerable, lo que dificulta la generación eficiente en dispositivos móviles. Proponemos CineMobile para cerrar esta brecha. En particular, CineMobile adopta una estrategia de optimización triple: (1) aprovechar un enfoque de poda guiada por destilación para obtener un modelo compacto pero eficiente que mantenga las capacidades esenciales de generación de video requeridas para efectos cinematográficos; (2) optimizar el modelo comprimido en un generador de 4 pasos mediante una combinación de destilación de difusión y aprendizaje por refuerzo; (3) emplear una estrategia de cuantización híbrida post-entrenamiento para comprimir el tamaño del modelo por debajo de 1 GB. Los resultados experimentales muestran que, en comparación con el modelo maestro basado en la arquitectura Wan 2.1, CineMobile logra una aceleración de 40x en la generación, manteniendo una calidad visual comparable. Específicamente, CineMobile genera videos de 49 fotogramas a 480p con una latencia de eliminación de ruido por paso de 0.6 s en una GPU NVIDIA H200 y de 20 s en la plataforma MediaTek Dimensity 8400 Ultimate 5G, con un uso máximo de memoria de 1.8 GB, lo que demuestra su aplicabilidad práctica para la creación de imagen a video en dispositivos móviles.
English
The growing demand for image-to-video creation on mobile devices has increasingly focused on cinematic motion effects like bullet time, dolly zoom, slow motion, etc. While Diffusion Transformers (DiTs) exhibit strong performance in video generation, their large parameter sizes and multi-step iterative denoising processes lead to substantial computational overhead, making efficient generation on mobile devices challenging. We propose CineMobile to bridge the gap. In particular, CineMobile adopts a three-fold optimization strategy: (1) leveraging a distillation-guided pruning approach to derive a compact yet efficient model that retains the essential video generation capabilities required for cinematic effects; (2) optimizing the compressed model into a 4-step generator via a combination of diffusion distillation and reinforcement learning; (3) employing a hybrid post-training quantization strategy to compress the model footprint to under 1 GB. Experimental results show that compared to the teacher model with the Wan 2.1 architecture, CineMobile achieves a 40x speedup in generation while maintaining comparable visual quality. Specifically, CineMobile generates 49-frame 480p videos with a per-step denoising latency of 0.6s on an NVIDIA H200 GPU and 20s on the MediaTek Dimensity 8400 Ultimate 5G platform, with a peak memory usage of 1.8 GB, demonstrating its practical applicability for mobile-based image-to-video creation.