Cache Consciente do Movimento para Geração Autoregressiva Eficiente de Vídeo
Motion-Aware Caching for Efficient Autoregressive Video Generation
May 3, 2026
Autores: Jing Xu, Yuexiao Ma, Songwei Liu, Xuzhe Zheng, Shiwei Liu, Chenqian Yan, Xiawu Zheng, Rongrong Ji, Fei Chao, Xing Wang
cs.AI
Resumo
Os paradigmas de geração de vídeo autoregressivos oferecem potencial teórico para a síntese de vídeos longos, mas sua implantação prática é dificultada pelo custo computacional da eliminação iterativa sequencial de ruído. Embora estratégias de reutilização de cache possam acelerar a geração ao pular etapas redundantes de eliminação de ruído, os métodos existentes dependem de um salto em nível de bloco de granularidade grossa que não consegue capturar a dinâmica de píxeis de granularidade fina. Esta omissão é crítica: píxeis com alto movimento exigem mais etapas de eliminação de ruído para evitar a acumulação de erros, enquanto píxeis estáticos toleram saltos agressivos. Formalizamos teoricamente esta perceção, relacionando os erros de cache à instabilidade residual, e propomos o MotionCache, uma estrutura de cache consciente do movimento que explora as diferenças interquadros como um proxy leve para as características de movimento a nível de píxel. O MotionCache emprega uma estratégia de grossa-a-fina: uma fase inicial de aquecimento estabelece coerência semântica, seguida pela reutilização de cache ponderada por movimento que ajusta dinamicamente as frequências de atualização por token. Experimentos extensivos em modelos de última geração como SkyReels-V2 e MAGI-1 demonstram que o MotionCache alcança acelerações significativas de 6,28 vezes e 1,64 vezes, respectivamente, preservando efetivamente a qualidade de geração (VBench: queda de 1% e queda de 0,01%, respectivamente). O código está disponível em https://github.com/ywlq/MotionCache.
English
Autoregressive video generation paradigms offer theoretical promise for long video synthesis, yet their practical deployment is hindered by the computational burden of sequential iterative denoising. While cache reuse strategies can accelerate generation by skipping redundant denoising steps, existing methods rely on coarse-grained chunk-level skipping that fails to capture fine-grained pixel dynamics. This oversight is critical: pixels with high motion require more denoising steps to prevent error accumulation, while static pixels tolerate aggressive skipping. We formalize this insight theoretically by linking cache errors to residual instability, and propose MotionCache, a motion-aware cache framework that exploits inter-frame differences as a lightweight proxy for pixel-level motion characteristics. MotionCache employs a coarse-to-fine strategy: an initial warm-up phase establishes semantic coherence, followed by motion-weighted cache reuse that dynamically adjusts update frequencies per token. Extensive experiments on state-of-the-art models like SkyReels-V2 and MAGI-1 demonstrate that MotionCache achieves significant speedups of 6.28times and 1.64times respectively, while effectively preserving generation quality (VBench: 1%downarrow and 0.01%downarrow respectively). The code is available at https://github.com/ywlq/MotionCache.