MemLearner: Leren om contextgeheugen op te vragen voor videowereldmodellen
MemLearner: Learning to Query Context memory for Video World Models
June 30, 2026
Auteurs: Jiwen Yu, Jianxiong Gao, Jianhong Bai, Yiran Qin, Kaiyi Huang, Quande Liu, Xintao Wang, Pengfei Wan, Kun Gai, Xihui Liu
cs.AI
Samenvatting
Videowereldmodellen zijn interactieve videogeneratiemodellen die toekomstige wereldtoestanden voorspellen op basis van gebruikersacties en historische videoframes. Een cruciale uitdaging in videowereldmodellen is het gebrek aan geheugen, wat leidt tot inconsistente gegenereerde scènes over langere tijdsperioden. Eerdere methoden onderzochten op regels gebaseerde contextframe-retrieval als geheugen, maar slagen er niet in te generaliseren in scenario's met scèneocclusies en dynamische objecten. Wij stellen MemLearner voor, een op leren gebaseerde adaptieve contextquerymethode die querytokens gebruikt om context- en voorspelde tokens met elkaar te verbinden. Door het videogeneratiemodel zelf te benutten voor het opvragen van context, maakt MemLearner gebruik van voorgetrainde visuele priori's zonder extra modules vanaf nul te trainen, en bevat het efficiënte strategieën voor training en inferentie. We hebben een dataset verzameld van lange video's met scèneocclusies en dynamische objecten, voorzien van camerapositieannotaties, en stellen een multi-dataset trainingsstrategie voor die zowel geannoteerde gerenderde als niet-geannoteerde real-world video's benut. Uitgebreide experimenten tonen aan dat MemLearner significant beter presteert dan eerdere videowereldmodellen op het gebied van scèneconsistentie en geheugen, met name in uitdagende occlusie- en dynamische scenario's.
English
Video World Models are interactive video generation models that predict future world states based on user actions and history video frames. A critical challenge in video world models is the lack of memory, causing inconsistent generated scenes over extended durations. Previous methods explored rule-based context frame retrieval as memory, but they fail to generalize in scenarios with scene occlusions and dynamic objects. We propose MemLearner, a learning-based adaptive context query method using query tokens to bridge context and predicted tokens. By leveraging the video generation model itself for context querying, MemLearner exploits pre-trained visual priors without training additional modules from scratch, and incorporates efficient strategies for training and inference. We collect a dataset of long videos with scene occlusions and dynamic objects, paired with camera pose annotations, and propose a multi-dataset training strategy leveraging both annotated rendered and unannotated real-world videos. Extensive experiments demonstrate that MemLearner significantly outperforms prior video world models in terms of scene consistency and memory, particularly under challenging occlusion and dynamic scenarios.