Rubricas de Percepção: Calibrando a Avaliação Multimodal para a Percepção Humana
PerceptionRubrics: Calibrating Multimodal Evaluation to Human Perception
June 26, 2026
Autores: Yana Wei, Hongbo Peng, Yanlin Lai, Liang Zhao, Kangheng Lin, En Yu, Keyu Lv, Han Zhou, Yin Tang, Haodong Li, Mitt Huang, Hangyu Guo, Jianjian Sun, Zheng Ge, Xiangyu Zhang, Daxin Jiang, Vishal M. Patel
cs.AI
Resumo
Apresentamos o PerceptionRubrics, um arcabouço de avaliação baseado em rubricas que aborda a lacuna entre pontuações saturadas em benchmarks e a fragilidade em situações reais. Deslocando a avaliação da correspondência semântica holística para uma auditoria atômica rigorosa, o PerceptionRubrics combina 1.038 imagens densas em informação com mais de 12.000 rubricas específicas por instância. Esses critérios são derivados de legendas douradas construídas por meio de um novo pipeline de consenso de Revisão por Pares Circular e, em seguida, destilados em um sistema de duplo fluxo de rubricas Must-Right (fatos essenciais) e Easy-Wrong (detalhes refinados). Crucialmente, o PerceptionRubrics implementa um mecanismo de Pontuação com Portão (Gated Scoring): diferentemente de médias lineares, falhas em fatos visuais obrigatórios acionam penalidades binárias acentuadas. Uma avaliação extensa revela insights críticos: (1) A Lacuna de Confiabilidade: modelos frequentemente verificam corretamente elementos fragmentados, mas falham em restrições conjuntivas estritas, expondo fragilidade em domínios densos; (2) A Estratificação Aberto-Fechado: contrariando tendências de raciocínio, revelamos um déficit de percepção persistente de 8% entre as fronteiras de código aberto e proprietário; e (3) O Rigor Alinhado ao Humano: nossas métricas com portão superam substancialmente benchmarks convencionais em alinhamento, validando que a fidelidade perceptual estrita é o pré-requisito para uma geração confiável.
English
We introduce PerceptionRubrics, a rubric-based evaluation framework that addresses the gap between saturated benchmark scores and real-world brittleness. Shifting evaluation from holistic semantic matching to rigorous atomic auditing, PerceptionRubrics pairs 1,038 information-dense images with over 12,000 instance-specific rubrics. These criteria are derived from golden captions constructed via a novel Circular Peer-Review consensus pipeline and then distilled into a dual-stream system of Must-Right (essential facts) and Easy-Wrong (fine-grained details) rubrics. Crucially, PerceptionRubrics implements a Gated Scoring mechanism: unlike linear averages, failure on mandatory visual facts triggers sharp binary penalties. Extensive evaluation yields critical insights: (1) The Reliability Gap: models often verify fragmented elements correctly yet fail strict conjunctive constraints, exposing brittleness in dense domains; (2) Open-Closed Stratification: contrary to reasoning trends, we reveal a persistent 8% perception deficit between open-source and proprietary frontiers; and (3) Human-Aligned Rigor: our gated metrics substantially out-align conventional benchmarks, validating that strict perceptual fidelity is the prerequisite for reliable generation.