Echo-Infinity : Apprentissage de la mémoire évolutive pour la génération de vidéo infinie en temps réel
Echo-Infinity: Learning Evolving Memory for Real-Time Infinite Video Generation
June 3, 2026
Auteurs: Yuxuan Bian, Zeyue Xue, Songchun Zhang, Shiyi Zhang, Weiyang Jin, Yaowei Li, Junhao Zhuang, Haoran Li, Jie Huang, Haoyang Huang, Nan Duan, Qiang Xu
cs.AI
Résumé
Nous présentons Echo-Infinity, un cadre autorégressif (AR) pour la génération vidéo infinie en temps réel, qui utilise une mémoire évolutive apprenable pour filtrer, abstraire et compresser dynamiquement tout historique de longueur arbitraire à coût constant. Les méthodes existantes gèrent principalement la mémoire avec des planifications de cache KV prédéfinies, une compression heuristique à rapport fixe ou une adaptation RoPE en inférence. Ces conceptions perdent inévitablement des informations historiques et amplifient les erreurs cumulées en raison de leur fenêtre de cache limitée et de leur ignorance du bruit de génération autorégressif. Inspiré par la consolidation de la mémoire humaine, Echo-Infinity remplace la gestion manuelle de la mémoire par des requêtes de mémoire apprenables (Memory Queries), mises à jour par l'attention et un mécanisme de portes lorsque les trames passées sont évincées de la fenêtre locale. Les requêtes sont optimisées de bout en bout avec les transformateurs de diffusion vidéo (DiTs), formant une mémoire évolutive qui prend en charge des rapports de compression arbitraires avec un calcul constant indépendant de la durée de la vidéo. Elles agissent également comme un a priori génératif généralisable, améliorant la qualité même lorsque seul l'état initial optimisé est utilisé. Nous introduisons en outre la Recette RoPE relative unifiée (Unified Relative RoPE Recipe), qui ancre les trames de départ à l'identifiant 0 et laisse l'identifiant de la trame la plus récente croître au maximum jusqu'à l'identifiant RoPE temporel maximal prédéfini des DiTs tout au long de l'entraînement et de l'inférence, libérant ainsi le modèle de la contrainte de RoPE finie et comblant le fossé d'extrapolation RoPE entre l'entraînement et le test. Dans la génération vidéo longue et courte, Echo-Infinity atteint des performances de pointe et, à notre connaissance, démontre pour la première fois des déploiements en temps réel de 24 heures (>1,3 million de trames), suggérant une voie pratique vers la génération vidéo infinie.
English
We present Echo Infinity, an autoregressive (AR) framework towards real-time infinite video generation that employs a learnable evolving memory to dynamically filter, abstract, and compress any-length history at constant cost. Existing methods mainly curate memory with predefined KV-cache schedules, fixed-ratio heuristic compression, or inference-time RoPE adaptation. These designs inevitably lose historical information and amplify compounding errors due to their limited cache window and ignorance of autoregressive generation noise. Inspired by human memory consolidation, Echo-Infinity replaces handcrafted memory curation with learnable Memory Query, which are updated by attention and a gating mechanism when past frames are evicted from the local window. The queries are optimized end-to-end with the video diffusion transformers (DiTs), forming an evolving memory that supports arbitrary compression ratios with constant computation independent of video length. They also act as a generalizable generation prior, improving quality even when only the optimized initial state is used. We further introduce Unified Relative RoPE Recipe, which anchors the sink frames to start from id 0 and lets the newest frame id grow at most to the DiTs' pretrained maximum temporal RoPE id throughout training and inference, freeing the model from the finite RoPE constraint and closing the train-test RoPE extrapolation gap. In long and short video generation, Echo-Infinity achieves state-of-the-art performance, and, to our knowledge, demonstrates promising 24-hour (>1.3 M frames) real-time rollouts for the first time, suggesting a practical path toward infinite video generation.