ChatPaper.aiChatPaper

Omni-Persona : Benchmarking systématique et amélioration de la personnalisation omnimodale

Omni-Persona: Systematic Benchmarking and Improving Omnimodal Personalization

May 11, 2026
Auteurs: Yeongtak Oh, Dongwook Lee, Sangkwon Park, Heeseung Kim, Sungroh Yoon
cs.AI

Résumé

Alors que les grands modèles de langage multimodaux ont progressé dans les domaines du texte, de l'image et de l'audio, la recherche en personnalisation est restée principalement axée sur le langage visuel, avec des bancs d'essai omnimodaux unifiés couvrant conjointement le texte, l'image et l'audio encore limités, et manquant de rigueur méthodologique pour prendre en compte les scénarios d'absence de persona ou les études d'ancrage systématiques. Nous présentons Omni-Persona, le premier banc d'essai complet pour la personnalisation omnimodale. Nous formalisons la tâche comme un routage cross-modal sur le graphe de modalité du persona, englobant 4 groupes de tâches et 18 tâches fines réparties sur environ 750 éléments. Pour diagnostiquer rigoureusement le comportement d'ancrage, nous proposons la précision calibrée (Précision calibrée, notée mathrm{Cal}), qui récompense conjointement un ancrage correct et une abstention appropriée, en intégrant les requêtes sans persona dans un cadre d'évaluation unifié. Sur nos expériences dédiées, trois résultats de diagnostic émergent : (i) les modèles open-source montrent un écart constant d'ancrage audio vs visuel que la RLVR réduit partiellement via une supervision dense basée sur des règles ; (ii) le rappel des réponses possibles et l'échelle des paramètres sont des diagnostics incomplets, car un rappel fort peut coexister avec une hallucination en l'absence de persona et les modèles plus grands n'atteignent pas toujours un Cal plus élevé, exposant la calibration comme un axe d'évaluation distinct ; et (iii) la SFT est limitée par la difficulté de construire une supervision de vérité terrain annotée à grande échelle, tandis que la RLVR généralise plus régulièrement grâce à un retour vérifiable au niveau des résultats, mais dérive vers un comportement conservateur et une qualité de génération inférieure sous notre conception de récompense. Omni-Persona sert donc de cadre de diagnostic qui met en lumière les pièges de la personnalisation omnimodale, guidant la conception future du post-entraînement et des récompenses.
English
While multimodal large language models have advanced across text, image, and audio, personalization research has remained primarily vision-language, with unified omnimodal benchmarking that jointly covers text, image, and audio still limited, and lacking the methodological rigor to account for absent-persona scenarios or systematic grounding studies. We introduce Omni-Persona, the first comprehensive benchmark for omnimodal personalization. We formalize the task as cross-modal routing over the Persona Modality Graph, encompassing 4 task groups and 18 fine-grained tasks across {sim}750 items. To rigorously diagnose grounding behavior, we propose Calibrated Accuracy (mathrm{Cal)}, which jointly rewards correct grounding and appropriate abstention, incorporating absent-persona queries within a unified evaluation framework. On our dedicated experiments, three diagnostic findings emerge: (i) open-source models show a consistent audio-vs-visual grounding gap that RLVR partially narrows via dense rule-based supervision; (ii) answerable recall and parameter scale are incomplete diagnostics, since strong recall can coexist with absent-persona hallucination and larger models do not always achieve higher Cal, exposing calibration as a separate evaluation axis; and (iii) SFT is bounded by the difficulty of constructing annotated ground-truth supervision at scale, while RLVR generalizes more consistently through outcome-level verifiable feedback yet drifts toward conservative behavior and lower generation quality under our reward design. Omni-Persona thus serves as a diagnostic framework that surfaces the pitfalls of omnimodal personalization, guiding future post-training and reward design.