CausalCine: Real-time autoregressieve generatie voor videoverhalen met meerdere shots
CausalCine: Real-Time Autoregressive Generation for Multi-Shot Video Narratives
May 12, 2026
Auteurs: Yihao Meng, Zichen Liu, Hao Ouyang, Qiuyu Wang, Ka Leong Cheng, Yue Yu, Hanlin Wang, Haobo Li, Jiapeng Zhu, Yanhong Zeng, Xing Zhu, Yujun Shen, Qifeng Chen, Huamin Qu
cs.AI
Samenvatting
Autoregressieve videogeneratie streeft naar real-time, open-eindige synthese. Toch is cinematografische verhalenvertelling niet slechts de eindeloze verlenging van één enkele scène; het vereist vooruitgang door evoluerende gebeurtenissen, veranderingen van camerastandpunt en discrete coupures. Bestaande autoregressieve modellen worstelen vaak met deze setting. Getraind voornamelijk voor kortetermijncontinuering, behandelen ze lange reeksen als uitgebreide enkele opnames, wat onvermijdelijk leidt tot bewegingsstagnatie en semantische drift tijdens lange uitrolprocedures. Om deze kloof te overbruggen introduceren we CausalCine, een interactief autoregressief raamwerk dat multi-shot videogeneratie transformeert tot een online regisseursproces. CausalCine genereert causaal over coupures heen, accepteert dynamische prompts ter plekke en hergebruikt context zonder eerdere opnames opnieuw te genereren. Om dit te bereiken trainen we eerst een causaal basismodel op native multi-shot reeksen om complexe overgangen tussen opnames te leren vóór versnelling. Vervolgens stellen we Content-Aware Memory Routing (CAMR) voor, dat dynamisch historische KV-entries ophaalt op basis van aandacht-gerelateerde relevantiescores in plaats van temporele nabijheid, waardoor cross-shot coherentie behouden blijft onder een beperkt actief geheugen. Tenslotte destilleren we het causale basismodel tot een generator met enkele stappen voor real-time interactieve generatie. Uitgebreide experimenten tonen aan dat CausalCine aanzienlijk beter presteert dan autoregressieve basislijnen en de capaciteit van bidirectionele modellen benadert, terwijl de streaming-interactiviteit van causale generatie wordt ontgrendeld. Demo beschikbaar op https://yihao-meng.github.io/CausalCine/
English
Autoregressive video generation aims at real-time, open-ended synthesis. Yet, cinematic storytelling is not merely the endless extension of a single scene; it requires progressing through evolving events, viewpoint shifts, and discrete shot boundaries. Existing autoregressive models often struggle in this setting. Trained primarily for short-horizon continuation, they treat long sequences as extended single shots, inevitably suffering from motion stagnation and semantic drift during long rollouts. To bridge this gap, we introduce CausalCine, an interactive autoregressive framework that transforms multi-shot video generation into an online directing process. CausalCine generates causally across shot changes, accepts dynamic prompts on the fly, and reuses context without regenerating previous shots. To achieve this, we first train a causal base model on native multi-shot sequences to learn complex shot transitions prior to acceleration. We then propose Content-Aware Memory Routing (CAMR), which dynamically retrieves historical KV entries according to attention-based relevance scores rather than temporal proximity, preserving cross-shot coherence under bounded active memory. Finally, we distill the causal base model into a few-step generator for real-time interactive generation. Extensive experiments demonstrate that CausalCine significantly outperforms autoregressive baselines and approaches the capability of bidirectional models while unlocking the streaming interactivity of causal generation. Demo available at https://yihao-meng.github.io/CausalCine/