MemLearner: Aprendendo a Consultar Memória de Contexto para Modelos de Mundo de Vídeo
MemLearner: Learning to Query Context memory for Video World Models
June 30, 2026
Autores: Jiwen Yu, Jianxiong Gao, Jianhong Bai, Yiran Qin, Kaiyi Huang, Quande Liu, Xintao Wang, Pengfei Wan, Kun Gai, Xihui Liu
cs.AI
Resumo
Modelos de Mundo de Vídeo são modelos de geração de vídeo interativos que preveem estados futuros do mundo com base nas ações do usuário e em quadros históricos de vídeo. Um desafio crítico em modelos de mundo de vídeo é a falta de memória, o que causa inconsistência nas cenas geradas ao longo de longas durações. Métodos anteriores exploraram a recuperação de quadros de contexto baseada em regras como memória, mas falham em generalizar em cenários com oclusões de cena e objetos dinâmicos. Propomos o MemLearner, um método adaptativo de consulta de contexto baseado em aprendizado que utiliza tokens de consulta para conectar tokens de contexto e previstos. Ao aproveitar o próprio modelo de geração de vídeo para a consulta de contexto, o MemLearner explora priores visuais pré-treinados sem treinar módulos adicionais do zero e incorpora estratégias eficientes para treinamento e inferência. Coletamos um conjunto de dados de vídeos longos com oclusões de cena e objetos dinâmicos, pareados com anotações de pose de câmera, e propomos uma estratégia de treinamento multi-conjunto de dados que aproveita tanto vídeos renderizados anotados quanto vídeos do mundo real não anotados. Experimentos extensivos demonstram que o MemLearner supera significativamente os modelos de mundo de vídeo anteriores em termos de consistência de cena e memória, particularmente em cenários desafiadores com oclusões e dinâmicas.
English
Video World Models are interactive video generation models that predict future world states based on user actions and history video frames. A critical challenge in video world models is the lack of memory, causing inconsistent generated scenes over extended durations. Previous methods explored rule-based context frame retrieval as memory, but they fail to generalize in scenarios with scene occlusions and dynamic objects. We propose MemLearner, a learning-based adaptive context query method using query tokens to bridge context and predicted tokens. By leveraging the video generation model itself for context querying, MemLearner exploits pre-trained visual priors without training additional modules from scratch, and incorporates efficient strategies for training and inference. We collect a dataset of long videos with scene occlusions and dynamic objects, paired with camera pose annotations, and propose a multi-dataset training strategy leveraging both annotated rendered and unannotated real-world videos. Extensive experiments demonstrate that MemLearner significantly outperforms prior video world models in terms of scene consistency and memory, particularly under challenging occlusion and dynamic scenarios.