CineMobile: On-Device Beeld-naar-Video Diffusie voor het Genereren van Cinematische Camerabewegingen
CineMobile: On-Device Image-to-Video Diffusion for Cinematic Camera Motion Generation
July 4, 2026
Auteurs: Xuyao Huang, Zelai Deng, Xu Wang, Xizhong Xiao, Zhijie Deng
cs.AI
Samenvatting
De groeiende vraag naar beeld-naar-video-creatie op mobiele apparaten richt zich steeds meer op cinematische bewegingseffecten zoals bullet time, dolly zoom, slow motion, enz. Hoewel Diffusion Transformers (DiTs) sterke prestaties leveren bij het genereren van video's, leiden hun grote parameteraantallen en meerstaps iteratieve denoisingprocessen tot aanzienlijke rekenkundige overhead, waardoor efficiënte generatie op mobiele apparaten een uitdaging vormt. Wij stellen CineMobile voor om deze kloof te overbruggen. In het bijzonder hanteert CineMobile een drieledige optimalisatiestrategie: (1) het benutten van een destillatiegestuurd snoeiaanpak om een compact maar efficiënt model af te leiden dat de essentiële videogeneratiecapaciteiten voor cinematische effecten behoudt; (2) het optimaliseren van het gecomprimeerde model tot een 4-staps generator via een combinatie van diffusiedestillatie en reinforcement learning; (3) het toepassen van een hybride post-training kwantiseringsstrategie om de modelomvang te comprimeren tot onder 1 GB. Experimentele resultaten tonen aan dat, vergeleken met het leraarmodel met de Wan 2.1-architectuur, CineMobile een 40x versnelling in generatie bereikt met behoud van vergelijkbare visuele kwaliteit. Specifiek genereert CineMobile 49-frame 480p-video's met een denoising-latentie per stap van 0,6 s op een NVIDIA H200 GPU en 20 s op het MediaTek Dimensity 8400 Ultimate 5G-platform, met een piekgeheugengebruik van 1,8 GB, wat de praktische toepasbaarheid ervan voor mobiele beeld-naar-video-creatie aantoont.
English
The growing demand for image-to-video creation on mobile devices has increasingly focused on cinematic motion effects like bullet time, dolly zoom, slow motion, etc. While Diffusion Transformers (DiTs) exhibit strong performance in video generation, their large parameter sizes and multi-step iterative denoising processes lead to substantial computational overhead, making efficient generation on mobile devices challenging. We propose CineMobile to bridge the gap. In particular, CineMobile adopts a three-fold optimization strategy: (1) leveraging a distillation-guided pruning approach to derive a compact yet efficient model that retains the essential video generation capabilities required for cinematic effects; (2) optimizing the compressed model into a 4-step generator via a combination of diffusion distillation and reinforcement learning; (3) employing a hybrid post-training quantization strategy to compress the model footprint to under 1 GB. Experimental results show that compared to the teacher model with the Wan 2.1 architecture, CineMobile achieves a 40x speedup in generation while maintaining comparable visual quality. Specifically, CineMobile generates 49-frame 480p videos with a per-step denoising latency of 0.6s on an NVIDIA H200 GPU and 20s on the MediaTek Dimensity 8400 Ultimate 5G platform, with a peak memory usage of 1.8 GB, demonstrating its practical applicability for mobile-based image-to-video creation.