ChatPaper.aiChatPaper

MemoBench: Avaliação de Modelagem do Mundo em Ambientes Dinamicamente Mutáveis

MemoBench: Benchmarking World Modeling in Dynamically Changing Environments

June 25, 2026
Autores: Haoyu Chen, Kaichen Zhou, Hang Hua, Kaile Zhang, Jingwen Qian, Wufei Ma, Haonan Chen, Chunjiang Liu, Yizhou Zhao, Xiaoyuan Wang, Weiyue Li, Alan Yuille, Paul Pu Liang, Yilun Du
cs.AI

Resumo

Modelos de geração de vídeo aspiram simular ambientes dinâmicos, e diversos benchmarks atualmente avaliam a consistência de memória entre quadros. No entanto, a maioria avalia a consistência apenas enquanto o alvo permanece visível, e os poucos que forçam objetos a sair de quadro avaliam cenas estáticas, onde nada muda durante a oclusão. Para preencher essa lacuna, apresentamos o MemoBench, um benchmark diagnóstico construído em torno do paradigma de desaparecimento e reaparecimento em ambientes dinamicamente mutáveis: um objeto alvo passa por um processo físico, desaparece de vista e deve ser corretamente recuperado em seu estado atualizado ao reaparecer. Curadoria de 360 clipes de referência verdadeira abrangendo cenas sintéticas e do mundo real, e projetamos um conjunto de avaliação que combina métricas automatizadas com avaliação baseada em VQA em quatro pilares diagnósticos. A avaliação de oito modelos de última geração revela insights fundamentais e desafios em aberto relacionados à consistência de memória sob o paradigma de desaparecimento e reaparecimento.
English
Video generation models aspire to simulate dynamic environments, and several benchmarks now evaluate memory consistency across frames. However, most assess consistency only while the target remains in view, and the few that force objects out of view evaluate static scenes where nothing changes during occlusion. To bridge this gap, we introduce MemoBench, a diagnostic benchmark built around the disappear-and-reappear paradigm in dynamically changing environments: a target object undergoes a physical process, disappears from view, and must be correctly recovered in its updated state upon reappearance. We curate 360 ground-truth clips spanning synthetic and real-world scenes, and design an evaluation suite combining automated metrics with VQA-based assessment across four diagnostic pillars. Evaluation of eight state-of-the-art models reveals key insights and open challenges regarding memory consistency under the disappear-and-reappear paradigm.