ChatPaper.aiChatPaper

Auto-Rubriek als Beloning: Van Impliciete Voorkeuren naar Expliciete Multimodale Generatieve Criteria

Auto-Rubric as Reward: From Implicit Preferences to Explicit Multimodal Generative Criteria

May 8, 2026
Auteurs: Juanxi Tian, Fengyuan Liu, Jiaming Han, Yilei Jiang, Yongliang Wu, Yesheng Liu, Haodong Li, Furong Xu, Wanhua Li
cs.AI

Samenvatting

Het afstemmen van multimodale generatieve modellen op menselijke voorkeuren vereist beloningssignalen die de compositionele, multidimensionale structuur van menselijke oordelen respecteren. Heersende RLHF-benaderingen reduceren deze structuur tot scalaire of paarsgewijze labels, waardoor genuanceerde voorkeuren worden samengevat in ondoorzichtige parametrische proxies en kwetsbaarheden voor beloningshacking bloot komen te liggen. Hoewel recente Rubrics-as-Reward (RaR)-methoden proberen deze structuur te herstellen via expliciete criteria, blijft het genereren van rubrics die tegelijkertijd betrouwbaar, schaalbaar en data-efficiënt zijn een open probleem. Wij introduceren Auto-Rubric as Reward (ARR), een raamwerk dat beloningsmodellering herkadert van impliciete gewichtsoptimalisatie naar expliciete, op criteria gebaseerde decompositie. Voor elke paarsgewijze vergelijking externaliseert ARR de geïnternaliseerde voorkeurskennis van een VLM als promptspecifieke rubrics, waarbij holistische intentie wordt vertaald naar onafhankelijk verifieerbare kwaliteitsdimensies. Deze omzetting van impliciete voorkeursstructuur in inspecteerbare, interpreteerbare beperkingen onderdrukt aanzienlijk evaluatievertekeningen zoals positionele bias, en maakt zowel zero-shot-implementatie als few-shot-conditionering met minimale supervisie mogelijk. Om deze winsten uit te breiden naar generatieve training, stellen wij Rubric Policy Optimization (RPO) voor, dat ARR's gestructureerde multidimensionale evaluatie distilleert tot een robuuste binaire beloning, waarbij ondoorzichtige scalaire regressie wordt vervangen door rubriek-geconditioneerde voorkeursbeslissingen die beleidsgradiënten stabiliseren. Op benchmarks voor tekst-naar-beeldgeneratie en beeldbewerking presteert ARR-RPO beter dan paarsgewijze beloningsmodellen en VLM-beoordelaars, wat aantoont dat het expliciet externaliseren van impliciete voorkeurskennis in gestructureerde rubrics leidt tot betrouwbaardere, data-efficiëntere multimodale afstemming, en onthult dat de bottleneck de afwezigheid is van een gefactoriseerde interface, niet een tekort aan kennis.
English
Aligning multimodal generative models with human preferences demands reward signals that respect the compositional, multi-dimensional structure of human judgment. Prevailing RLHF approaches reduce this structure to scalar or pairwise labels, collapsing nuanced preferences into opaque parametric proxies and exposing vulnerabilities to reward hacking. While recent Rubrics-as-Reward (RaR) methods attempt to recover this structure through explicit criteria, generating rubrics that are simultaneously reliable, scalable, and data-efficient remains an open problem. We introduce Auto-Rubric as Reward (ARR), a framework that reframes reward modeling from implicit weight optimization to explicit, criteria-based decomposition. Before any pairwise comparison, ARR externalizes a VLM's internalized preference knowledge as prompt-specific rubrics, translating holistic intent into independently verifiable quality dimensions. This conversion of implicit preference structure into inspectable, interpretable constraints substantially suppresses evaluation biases including positional bias, enabling both zero-shot deployment and few-shot conditioning on minimal supervision. To extend these gains into generative training, we propose Rubric Policy Optimization (RPO), which distills ARR's structured multi-dimensional evaluation into a robust binary reward, replacing opaque scalar regression with rubric-conditioned preference decisions that stabilize policy gradients. On text-to-image generation and image editing benchmarks, ARR-RPO outperforms pairwise reward models and VLM judges, demonstrating that explicitly externalizing implicit preference knowledge into structured rubrics achieves more reliable, data-efficient multimodal alignment, revealing that the bottleneck is the absence of a factorized interface, not a deficit of knowledge.