SuperMemory-VQA : Un benchmark de question-réponse visuelle égocentrique pour la mémoire à long horizon
SuperMemory-VQA: An Egocentric Visual Question-Answering Benchmark for Long-Horizon Memory
May 30, 2026
Auteurs: Samiul Alam, Shakhrul Iman Siam, Michael J. Proulx, James Fort, Richard Newcombe, Hyo Jin Kim, Mi Zhang
cs.AI
Résumé
Les lunettes IA constituent une plateforme prometteuse pour des agents d’IA agissant comme assistants de mémoire personnalisés. Pour être réellement utiles, ces systèmes doivent dépasser la compréhension vidéo à court terme et combler les lacunes de mémoire que les humains rencontrent à des fins pratiques, personnelles ou sociales, sur des flux vidéo égocentriques longitudinalux. Cependant, les ensembles de données égocentriques existants se concentrent principalement sur la reconnaissance d’actions ou des questions-réponses génériques à partir de courts clips, mesurant des capacités perceptuelles plutôt que des besoins réalistes de mémoire humaine. Nous présentons SuperMemory-VQA, un ensemble de données de questions-réponses visuelles (VQA) égocentriques destiné à évaluer les assistants IA sur des tâches de mémoire pratiques et à long terme. Il contient 52,9 heures d’activités quotidiennes enregistrées avec des lunettes IA, incluant une vidéo RVB synchronisée, une transcription audio, le regard oculaire, l’IMU et les trajectoires SLAM. Grâce à un pipeline d’annotation vérifié par des humains, nous construisons 4 853 paires question-réponse fondées, couvrant la mémoire des objets et des lieux, le rappel d’intention, le rappel de scène visuelle, la reconstruction temporelle, la mémoire conversationnelle et le recherche contextuelle. Chaque question est formulée sous forme de choix multiples avec une option explicite « impossible à répondre » pour tester la robustesse face aux hallucinations. L’évaluation comparative des principaux cadres agentiques et architectures de fondations de LLM révèle que les systèmes existants restent loin d’être fiables pour les tâches de mémoire réelles, soulignant le besoin de nouvelles architectures pour une mémoire IA fondée, capable de répondre uniquement lorsque les preuves sont suffisantes. Une enquête auprès des participants confirme en outre que nos questions sont réalistes, utiles et alignées sur les besoins quotidiens de mémoire.
English
AI glasses present a compelling platform for AI agents to serve as personalized memory assistants. To be genuinely useful, such systems must move beyond short-term video comprehension and address memory gaps that humans experience for practical, personal, or social purposes over longitudinal egocentric video streams. However, existing egocentric datasets predominantly focus on action recognition or generic QAs from short clips, measuring perceptual capabilities rather than realistic human memory needs. We introduce SuperMemory-VQA, an egocentric visual question answering (VQA) dataset for evaluating AI assistants on practical, long-horizon memory tasks. It contains 52.9 hours of everyday activities recorded with AI glasses, including synchronized RGB video, audio transcription, eye gaze, IMU, and SLAM trajectories. Through a human-verified annotation pipeline, we construct grounded 4,853 question-answer pairs that span object and location memory, intent recall, visual scene recall, timeline reconstruction, conversational memory, and in-context retrieval. Each question is posed as multiple-choice with an explicit "unanswerable" option to test hallucination robustness. Benchmarking leading agentic frameworks and LLM backbones reveals that existing systems remain far from reliable on real-world memory tasks, highlighting the need for new architectures for grounded AI memory that can answer only when evidence is sufficient. A participant survey further supports that our questions are realistic, useful, and aligned with everyday memory needs.