ChatPaper.aiChatPaper

CausalCine: Geração Autoregressiva em Tempo Real para Narrativas de Vídeo com Múltiplas Tomadas

CausalCine: Real-Time Autoregressive Generation for Multi-Shot Video Narratives

May 12, 2026
Autores: Yihao Meng, Zichen Liu, Hao Ouyang, Qiuyu Wang, Ka Leong Cheng, Yue Yu, Hanlin Wang, Haobo Li, Jiapeng Zhu, Yanhong Zeng, Xing Zhu, Yujun Shen, Qifeng Chen, Huamin Qu
cs.AI

Resumo

A geração de vídeo autorregressiva visa à síntese em tempo real e de final aberto. No entanto, a narrativa cinematográfica não é meramente a extensão infinita de uma única cena; ela requer o progresso através de eventos em evolução, mudanças de ponto de vista e limites discretos de plano. Os modelos autorregressivos existentes frequentemente têm dificuldade nesse cenário. Treinados principalmente para continuação de curto horizonte, eles tratam sequências longas como planos únicos estendidos, sofrendo inevitavelmente de estagnação de movimento e desvio semântico durante rollouts longos. Para preencher essa lacuna, apresentamos o CausalCine, uma estrutura autorregressiva interativa que transforma a geração de vídeo multiplano em um processo de direção online. O CausalCine gera causalmente através de mudanças de plano, aceita prompts dinâmicos em tempo real e reutiliza contexto sem regenerar planos anteriores. Para isso, primeiro treinamos um modelo base causal em sequências multiplano nativas para aprender transições complexas de plano antes da aceleração. Em seguida, propomos o Roteamento de Memória Sensível ao Conteúdo (CAMR), que recupera dinamicamente entradas KV históricas com base em pontuações de relevância de atenção, em vez de proximidade temporal, preservando a coerência entre planos sob memória ativa limitada. Por fim, destilamos o modelo base causal em um gerador de poucas etapas para geração interativa em tempo real. Experimentos extensos demonstram que o CausalCine supera significativamente as linhas de base autorregressivas e se aproxima da capacidade dos modelos bidirecionais, ao mesmo tempo que desbloqueia a interatividade em streaming da geração causal. Demonstração disponível em https://yihao-meng.github.io/CausalCine/
English
Autoregressive video generation aims at real-time, open-ended synthesis. Yet, cinematic storytelling is not merely the endless extension of a single scene; it requires progressing through evolving events, viewpoint shifts, and discrete shot boundaries. Existing autoregressive models often struggle in this setting. Trained primarily for short-horizon continuation, they treat long sequences as extended single shots, inevitably suffering from motion stagnation and semantic drift during long rollouts. To bridge this gap, we introduce CausalCine, an interactive autoregressive framework that transforms multi-shot video generation into an online directing process. CausalCine generates causally across shot changes, accepts dynamic prompts on the fly, and reuses context without regenerating previous shots. To achieve this, we first train a causal base model on native multi-shot sequences to learn complex shot transitions prior to acceleration. We then propose Content-Aware Memory Routing (CAMR), which dynamically retrieves historical KV entries according to attention-based relevance scores rather than temporal proximity, preserving cross-shot coherence under bounded active memory. Finally, we distill the causal base model into a few-step generator for real-time interactive generation. Extensive experiments demonstrate that CausalCine significantly outperforms autoregressive baselines and approaches the capability of bidirectional models while unlocking the streaming interactivity of causal generation. Demo available at https://yihao-meng.github.io/CausalCine/