ChatPaper.aiChatPaper

CineMobile : Diffusion image-à-vidéo sur appareil pour la génération de mouvements de caméra cinématographiques

CineMobile: On-Device Image-to-Video Diffusion for Cinematic Camera Motion Generation

July 4, 2026
Auteurs: Xuyao Huang, Zelai Deng, Xu Wang, Xizhong Xiao, Zhijie Deng
cs.AI

Résumé

La demande croissante de création d’images en vidéo sur les appareils mobiles s’est de plus en plus concentrée sur les effets de mouvement cinématographiques tels que le bullet time, le dolly zoom, le ralenti, etc. Bien que les transformateurs de diffusion (DiTs) présentent de bonnes performances dans la génération de vidéos, leur grande taille de paramètres et leurs processus de débruitage itératifs en plusieurs étapes entraînent une surcharge de calcul importante, ce qui rend difficile une génération efficace sur les appareils mobiles. Nous proposons CineMobile pour combler cette lacune. En particulier, CineMobile adopte une stratégie d’optimisation en trois volets : (1) l’exploitation d’une approche d’élagage guidé par distillation pour obtenir un modèle compact mais efficace qui conserve les capacités essentielles de génération vidéo requises pour les effets cinématographiques ; (2) l’optimisation du modèle compressé en un générateur en 4 étapes via une combinaison de distillation de diffusion et d’apprentissage par renforcement ; (3) l’emploi d’une stratégie de quantification hybride post-entraînement pour compresser l’empreinte du modèle à moins de 1 Go. Les résultats expérimentaux montrent que, comparé au modèle enseignant avec l’architecture Wan 2.1, CineMobile atteint une accélération de 40x de la génération tout en maintenant une qualité visuelle comparable. Plus précisément, CineMobile génère des vidéos de 49 images en 480p avec une latence de débruitage par étape de 0,6 s sur un GPU NVIDIA H200 et de 20 s sur la plateforme MediaTek Dimensity 8400 Ultimate 5G, avec une utilisation mémoire maximale de 1,8 Go, démontrant ainsi son applicabilité pratique pour la création d’images en vidéo sur mobile.
English
The growing demand for image-to-video creation on mobile devices has increasingly focused on cinematic motion effects like bullet time, dolly zoom, slow motion, etc. While Diffusion Transformers (DiTs) exhibit strong performance in video generation, their large parameter sizes and multi-step iterative denoising processes lead to substantial computational overhead, making efficient generation on mobile devices challenging. We propose CineMobile to bridge the gap. In particular, CineMobile adopts a three-fold optimization strategy: (1) leveraging a distillation-guided pruning approach to derive a compact yet efficient model that retains the essential video generation capabilities required for cinematic effects; (2) optimizing the compressed model into a 4-step generator via a combination of diffusion distillation and reinforcement learning; (3) employing a hybrid post-training quantization strategy to compress the model footprint to under 1 GB. Experimental results show that compared to the teacher model with the Wan 2.1 architecture, CineMobile achieves a 40x speedup in generation while maintaining comparable visual quality. Specifically, CineMobile generates 49-frame 480p videos with a per-step denoising latency of 0.6s on an NVIDIA H200 GPU and 20s on the MediaTek Dimensity 8400 Ultimate 5G platform, with a peak memory usage of 1.8 GB, demonstrating its practical applicability for mobile-based image-to-video creation.