PersonaVLM : Modèles de langage multimodaux personnalisés à long terme
PersonaVLM: Long-Term Personalized Multimodal LLMs
March 20, 2026
Auteurs: Chang Nie, Chaoyou Fu, Yifan Zhang, Haihua Yang, Caifeng Shan
cs.AI
Résumé
Les modèles de langage de grande taille multimodaux (MLLM) servent d'assistants quotidiens à des millions d'utilisateurs. Cependant, leur capacité à générer des réponses alignées sur les préférences individuelles reste limitée. Les approches antérieures ne permettent qu'une personnalisation statique et en un seul tour via l'augmentation des entrées ou l'alignement des sorties, et échouent ainsi à capturer l'évolution des préférences et de la personnalité des utilisateurs dans le temps (voir Fig.1). Dans cet article, nous présentons PersonaVLM, un cadre innovant d'agent multimodal personnalisé conçu pour une personnalisation à long terme. Il transforme un MLLM généraliste en assistant personnalisé en intégrant trois capacités clés : (a) Mémorisation : Il extrait et résume de manière proactive des mémoires multimodales chronologiques issues des interactions, en les consolidant dans une base de données personnalisée. (b) Raisonnement : Il effectue un raisonnement multi-tours en récupérant et en intégrant les mémoires pertinentes de la base de données. (c) Alignement des réponses : Il infère la personnalité évolutive de l'utilisateur tout au long des interactions à long terme pour garantir que les sorties restent alignées avec ses caractéristiques uniques. Pour l'évaluation, nous établissons Persona-MME, un benchmark complet comprenant plus de 2000 cas d'interaction soigneusement sélectionnés, conçu pour évaluer la personnalisation à long terme des MLLM sur sept aspects clés et 14 tâches granulaires. Des expériences approfondies valident l'efficacité de notre méthode, améliorant la baseline de 22,4% (Persona-MME) et 9,8% (PERSONAMEM) sous un contexte de 128k, tout en surpassant GPT-4o de 5,2% et 2,0%, respectivement. Page du projet : https://PersonaVLM.github.io.
English
Multimodal Large Language Models (MLLMs) serve as daily assistants for millions. However, their ability to generate responses aligned with individual preferences remains limited. Prior approaches enable only static, single-turn personalization through input augmentation or output alignment, and thus fail to capture users' evolving preferences and personality over time (see Fig.1). In this paper, we introduce PersonaVLM, an innovative personalized multimodal agent framework designed for long-term personalization. It transforms a general-purpose MLLM into a personalized assistant by integrating three key capabilities: (a) Remembering: It proactively extracts and summarizes chronological multimodal memories from interactions, consolidating them into a personalized database. (b) Reasoning: It conducts multi-turn reasoning by retrieving and integrating relevant memories from the database. (c) Response Alignment: It infers the user's evolving personality throughout long-term interactions to ensure outputs remain aligned with their unique characteristics. For evaluation, we establish Persona-MME, a comprehensive benchmark comprising over 2,000 curated interaction cases, designed to assess long-term MLLM personalization across seven key aspects and 14 fine-grained tasks. Extensive experiments validate our method's effectiveness, improving the baseline by 22.4% (Persona-MME) and 9.8% (PERSONAMEM) under a 128k context, while outperforming GPT-4o by 5.2% and 2.0%, respectively. Project page: https://PersonaVLM.github.io.