ChatPaper.aiChatPaper

CineMobile: Difusão de Imagem para Vídeo no Dispositivo para Geração de Movimento de Câmera Cinematográfica

CineMobile: On-Device Image-to-Video Diffusion for Cinematic Camera Motion Generation

July 4, 2026
Autores: Xuyao Huang, Zelai Deng, Xu Wang, Xizhong Xiao, Zhijie Deng
cs.AI

Resumo

A crescente demanda pela criação de imagem para vídeo em dispositivos móveis tem se concentrado cada vez mais em efeitos cinematográficos como bullet time, dolly zoom, câmera lenta, entre outros. Embora os Transformers de Difusão (DiTs) apresentem desempenho robusto na geração de vídeos, seus grandes tamanhos de parâmetros e processos iterativos de remoção de ruído em múltiplas etapas geram uma sobrecarga computacional significativa, tornando a geração eficiente em dispositivos móveis um desafio. Propomos o CineMobile para preencher essa lacuna. Especificamente, o CineMobile adota uma estratégia de otimização tripla: (1) aproveitamento de uma abordagem de poda guiada por destilação para obter um modelo compacto, porém eficiente, que retenha as capacidades essenciais de geração de vídeo necessárias para efeitos cinematográficos; (2) otimização do modelo comprimido em um gerador de 4 etapas por meio de uma combinação de destilação por difusão e aprendizado por reforço; (3) emprego de uma estratégia híbrida de quantização pós-treinamento para comprimir o tamanho do modelo para menos de 1 GB. Resultados experimentais mostram que, em comparação com o modelo professor baseado na arquitetura Wan 2.1, o CineMobile alcança uma aceleração de 40x na geração, mantendo qualidade visual comparável. Especificamente, o CineMobile gera vídeos de 49 quadros em resolução 480p com uma latência de remoção de ruído por etapa de 0,6s em uma GPU NVIDIA H200 e 20s na plataforma MediaTek Dimensity 8400 Ultimate 5G, com um pico de uso de memória de 1,8 GB, demonstrando sua aplicabilidade prática para a criação de imagem para vídeo em dispositivos móveis.
English
The growing demand for image-to-video creation on mobile devices has increasingly focused on cinematic motion effects like bullet time, dolly zoom, slow motion, etc. While Diffusion Transformers (DiTs) exhibit strong performance in video generation, their large parameter sizes and multi-step iterative denoising processes lead to substantial computational overhead, making efficient generation on mobile devices challenging. We propose CineMobile to bridge the gap. In particular, CineMobile adopts a three-fold optimization strategy: (1) leveraging a distillation-guided pruning approach to derive a compact yet efficient model that retains the essential video generation capabilities required for cinematic effects; (2) optimizing the compressed model into a 4-step generator via a combination of diffusion distillation and reinforcement learning; (3) employing a hybrid post-training quantization strategy to compress the model footprint to under 1 GB. Experimental results show that compared to the teacher model with the Wan 2.1 architecture, CineMobile achieves a 40x speedup in generation while maintaining comparable visual quality. Specifically, CineMobile generates 49-frame 480p videos with a per-step denoising latency of 0.6s on an NVIDIA H200 GPU and 20s on the MediaTek Dimensity 8400 Ultimate 5G platform, with a peak memory usage of 1.8 GB, demonstrating its practical applicability for mobile-based image-to-video creation.