MemoBench: Benchmarken van wereldmodellering in dynamisch veranderende omgevingen
MemoBench: Benchmarking World Modeling in Dynamically Changing Environments
June 25, 2026
Auteurs: Haoyu Chen, Kaichen Zhou, Hang Hua, Kaile Zhang, Jingwen Qian, Wufei Ma, Haonan Chen, Chunjiang Liu, Yizhou Zhao, Xiaoyuan Wang, Weiyue Li, Alan Yuille, Paul Pu Liang, Yilun Du
cs.AI
Samenvatting
Videogeneratiemodellen streven ernaar dynamische omgevingen te simuleren, en verschillende benchmarks evalueren nu geheugenconsistentie over frames heen. De meeste beoordelen echter alleen consistentie zolang het doelwit in beeld blijft, en de weinige testen die objecten uit beeld dwingen, evalueren statische scènes waarin niets verandert tijdens occlusie. Om deze kloof te overbruggen introduceren we MemoBench, een diagnostische benchmark die is gebouwd rond het verdwijn-en-verschijn-paradigma in dynamisch veranderende omgevingen: een doelobject ondergaat een fysiek proces, verdwijnt uit beeld, en moet bij terugkeer correct worden hersteld in de bijgewerkte staat. We beheren 360 ground-truth clips die zowel synthetische als echte scènes omvatten, en ontwerpen een evaluatiesuite die geautomatiseerde metrieken combineert met VQA-gebaseerde beoordeling over vier diagnostische pijlers. Evaluatie van acht state-of-the-art modellen onthult belangrijke inzichten en openstaande uitdagingen met betrekking tot geheugenconsistentie onder het verdwijn-en-verschijn-paradigma.
English
Video generation models aspire to simulate dynamic environments, and several benchmarks now evaluate memory consistency across frames. However, most assess consistency only while the target remains in view, and the few that force objects out of view evaluate static scenes where nothing changes during occlusion. To bridge this gap, we introduce MemoBench, a diagnostic benchmark built around the disappear-and-reappear paradigm in dynamically changing environments: a target object undergoes a physical process, disappears from view, and must be correctly recovered in its updated state upon reappearance. We curate 360 ground-truth clips spanning synthetic and real-world scenes, and design an evaluation suite combining automated metrics with VQA-based assessment across four diagnostic pillars. Evaluation of eight state-of-the-art models reveals key insights and open challenges regarding memory consistency under the disappear-and-reappear paradigm.