Omni-Persona: Benchmarking Sistemático e Melhoria da Personalização Omnimodal
Omni-Persona: Systematic Benchmarking and Improving Omnimodal Personalization
May 11, 2026
Autores: Yeongtak Oh, Dongwook Lee, Sangkwon Park, Heeseung Kim, Sungroh Yoon
cs.AI
Resumo
Embora modelos de linguagem multimodal de grande escala tenham avançado em texto, imagem e áudio, a pesquisa em personalização permaneceu predominantemente visão-linguagem, com benchmarks omnimodais unificados que cobrem conjuntamente texto, imagem e áudio ainda limitados, e carecendo do rigor metodológico para considerar cenários de persona ausente ou estudos sistemáticos de ancoragem. Apresentamos o Omni-Persona, o primeiro benchmark abrangente para personalização omnimodal. Formalizamos a tarefa como roteamento cross-modal sobre o Grafo de Modalidade de Persona, abrangendo 4 grupos de tarefas e 18 tarefas refinadas em aproximadamente 750 itens. Para diagnosticar rigorosamente o comportamento de ancoragem, propomos a Acurácia Calibrada (Cal), que recompensa conjuntamente a ancoragem correta e a abstenção apropriada, incorporando consultas de persona ausente em um quadro de avaliação unificado. Em nossos experimentos dedicados, três descobertas diagnósticas emergem: (i) modelos de código aberto mostram uma lacuna consistente de ancoragem entre áudio e visual que o RLVR reduz parcialmente por meio de supervisão densa baseada em regras; (ii) a revocação (recall) respondível e a escala de parâmetros são diagnósticos incompletos, uma vez que uma forte revocação pode coexistir com alucinação de persona ausente e modelos maiores nem sempre alcançam uma Cal mais alta, expondo a calibração como um eixo de avaliação separado; e (iii) o SFT é limitado pela dificuldade de construir supervisão de referência (ground-truth) anotada em escala, enquanto o RLVR generaliza de forma mais consistente por meio de feedback verificável em nível de resultado, mas tende a um comportamento conservador e menor qualidade de geração sob nosso design de recompensa. O Omni-Persona serve, portanto, como um quadro diagnóstico que expõe as armadilhas da personalização omnimodal, orientando futuros designs de pós-treinamento e recompensa.
English
While multimodal large language models have advanced across text, image, and audio, personalization research has remained primarily vision-language, with unified omnimodal benchmarking that jointly covers text, image, and audio still limited, and lacking the methodological rigor to account for absent-persona scenarios or systematic grounding studies. We introduce Omni-Persona, the first comprehensive benchmark for omnimodal personalization. We formalize the task as cross-modal routing over the Persona Modality Graph, encompassing 4 task groups and 18 fine-grained tasks across {sim}750 items. To rigorously diagnose grounding behavior, we propose Calibrated Accuracy (mathrm{Cal)}, which jointly rewards correct grounding and appropriate abstention, incorporating absent-persona queries within a unified evaluation framework. On our dedicated experiments, three diagnostic findings emerge: (i) open-source models show a consistent audio-vs-visual grounding gap that RLVR partially narrows via dense rule-based supervision; (ii) answerable recall and parameter scale are incomplete diagnostics, since strong recall can coexist with absent-persona hallucination and larger models do not always achieve higher Cal, exposing calibration as a separate evaluation axis; and (iii) SFT is bounded by the difficulty of constructing annotated ground-truth supervision at scale, while RLVR generalizes more consistently through outcome-level verifiable feedback yet drifts toward conservative behavior and lower generation quality under our reward design. Omni-Persona thus serves as a diagnostic framework that surfaces the pitfalls of omnimodal personalization, guiding future post-training and reward design.