M^3Eval : Évaluation de la mémoire multimodale via des tâches vidéo ancrées cognitivement
M^3Eval: Multi-Modal Memory Evaluation through Cognitively-Grounded Video Tasks
June 3, 2026
Auteurs: Jie Huang, Ruixun Liu, Sirui Sun, Xinyi Yang, Yin Li, Yixin Zhu, Yiwu Zhong
cs.AI
Résumé
À mesure que les modèles multimodaux progressent vers la compréhension de vidéos longues, la mémoire émerge comme une capacité critique. Malgré des efforts considérables pour développer des ensembles de données et des benchmarks vidéo, les travaux existants se concentrent principalement sur la perception et le raisonnement, sans évaluer systématiquement la mémoire : ce que les modèles retiennent, la fidélité avec laquelle l'information est préservée et la robustesse de la mémoire face aux interférences. Pour combler cette lacune, nous présentons M^3Eval, le premier cadre d'évaluation et benchmark complet conçu pour sonder différentes dimensions de la mémoire dans les modèles multimodaux. Ancré dans la psychologie cognitive, notre conception repose sur des tâches soigneusement construites qui isolent les aspects clés de la mémoire. En exploitant M^3Eval, nous menons des expériences approfondies sur des modèles multimodaux représentatifs, révélant des faiblesses cohérentes et des comportements distinctifs. Nous constatons que les modèles peinent à maintenir des représentations désentrelacées lors du traitement de flux vidéo parallèles, présentent des schémas d'interférence qui diffèrent considérablement de ceux observés dans la mémoire humaine, ancrent les sources de mémoire de manière plus fiable dans le domaine spatial que temporel, et montrent une mémoire symbolique limitée. Collectivement, notre benchmark constitue une ressource précieuse pour les recherches futures, tandis que nos résultats soulignent la mémoire comme une capacité fondamentale mais encore sous-explorée, et offrent des pistes pour concevoir des mécanismes de mémoire plus efficaces dans les modèles multimodaux. Notre code et notre ensemble de données sont disponibles à l'adresse https://pku-value-lab.github.io/m3eval-homepage.
English
As multi-modal models advance towards long-form video understanding, memory emerges as a critical capability. Despite substantial efforts in developing video datasets and benchmarks, existing works primarily focus on perception and reasoning, without systematically evaluating memory: what models retain, how faithfully information is preserved, and how robust memory remains under interference. To address this gap, we introduce M^3Eval, the first comprehensive evaluation framework and benchmark for probing different memory dimensions in multi-modal models. Grounded in cognitive psychology, our design features carefully constructed tasks that isolate key aspects of memory. Leveraging M^3Eval, we conduct extensive experiments across representative multi-modal models, revealing consistent weaknesses and distinctive behaviors. We find that models struggle to maintain disentangled representations when processing parallel video streams, exhibit interference patterns differing substantially from those observed in human memory, ground memory sources more reliably in the spatial domain than the temporal domain, and demonstrate limited symbolic memory. Collectively, our benchmark provides a valuable resource for future research, while our findings highlight memory as a fundamental yet underexplored capability and offer insights for designing more effective memory mechanisms in multi-modal models. Our code and dataset are available at https://pku-value-lab.github.io/m3eval-homepage.