ChatPaper.aiChatPaper

PerceptionRubrics: Het ijken van multimodale evaluatie aan menselijke perceptie

PerceptionRubrics: Calibrating Multimodal Evaluation to Human Perception

June 26, 2026
Auteurs: Yana Wei, Hongbo Peng, Yanlin Lai, Liang Zhao, Kangheng Lin, En Yu, Keyu Lv, Han Zhou, Yin Tang, Haodong Li, Mitt Huang, Hangyu Guo, Jianjian Sun, Zheng Ge, Xiangyu Zhang, Daxin Jiang, Vishal M. Patel
cs.AI

Samenvatting

Wij introduceren PerceptionRubrics, een op rubrieken gebaseerd evaluatiekader dat de kloof overbrugt tussen verzadigde benchmarkscores en broosheid in de echte wereld. Door de evaluatie te verschuiven van holistische semantische matching naar rigoureuze atomaire auditing, koppelt PerceptionRubrics 1.038 informatie-dichte afbeeldingen aan meer dan 12.000 instantie-specifieke rubrieken. Deze criteria zijn afgeleid van gouden bijschriften die zijn geconstrueerd via een nieuwe circulaire peer-review consensuspijplijn en vervolgens gedistilleerd tot een tweestromig systeem van Must-Right (essentiële feiten) en Easy-Wrong (fijnmazige details) rubrieken. Cruciaal is dat PerceptionRubrics een Gated Scoring-mechanisme implementeert: in tegenstelling tot lineaire gemiddelden leidt falen bij verplichte visuele feiten tot scherpe binaire straffen. Uitgebreide evaluatie levert cruciale inzichten op: (1) De Betrouwbaarheidskloof: modellen verifiëren vaak gefragmenteerde elementen correct, maar falen bij strikte conjunctieve beperkingen, wat broosheid in dichte domeinen blootlegt; (2) Open-Gesloten Stratificatie: in tegenstelling tot redeneertrends onthullen we een aanhoudend perceptietekort van 8% tussen open-source en propriëtaire grenzen; en (3) Menselijk-Gerichte Nauwkeurigheid: onze gated metrics sluiten aanzienlijk beter aan dan conventionele benchmarks, wat bevestigt dat strikte perceptuele getrouwheid de voorwaarde is voor betrouwbare generatie.
English
We introduce PerceptionRubrics, a rubric-based evaluation framework that addresses the gap between saturated benchmark scores and real-world brittleness. Shifting evaluation from holistic semantic matching to rigorous atomic auditing, PerceptionRubrics pairs 1,038 information-dense images with over 12,000 instance-specific rubrics. These criteria are derived from golden captions constructed via a novel Circular Peer-Review consensus pipeline and then distilled into a dual-stream system of Must-Right (essential facts) and Easy-Wrong (fine-grained details) rubrics. Crucially, PerceptionRubrics implements a Gated Scoring mechanism: unlike linear averages, failure on mandatory visual facts triggers sharp binary penalties. Extensive evaluation yields critical insights: (1) The Reliability Gap: models often verify fragmented elements correctly yet fail strict conjunctive constraints, exposing brittleness in dense domains; (2) Open-Closed Stratification: contrary to reasoning trends, we reveal a persistent 8% perception deficit between open-source and proprietary frontiers; and (3) Human-Aligned Rigor: our gated metrics substantially out-align conventional benchmarks, validating that strict perceptual fidelity is the prerequisite for reliable generation.