ChatPaper.aiChatPaper

DeltaRubric: Generatieve multimodale beloningsmodellering via gezamenlijke planning en verificatie

DeltaRubric: Generative Multimodal Reward Modeling via Joint Planning and Verification

May 10, 2026
Auteurs: Rui Liu, Dian Yu, Zhenwen Liang, Yucheng Shi, Tong Zheng, Runpeng Dai, Haitao Mi, Pratap Tokekar, Leoweiliang
cs.AI

Samenvatting

Het afstemmen van multimodale grote taalmodellen (MLLM's) vereist betrouwbare beloningsmodellen, maar bestaande eenstapsevaluatoren kunnen last hebben van lui beoordelen, door taalprioriteiten te gebruiken in plaats van fijnmazige visuele verificatie. Hoewel rubric-gebaseerde evaluatie deze vertekeningen in tekst-only omgevingen vermindert, wordt de uitbreiding ervan naar multimodale taken belemmerd door de complexiteit van visueel redeneren. De cruciale verschillen tussen antwoorden hangen vaak af van instantie-specifieke visuele details. Robuuste evaluatie vereist het dynamisch synthetiseren van rubrics die ruimtelijke en feitelijke discrepanties isoleren. Om dit aan te pakken introduceren we DeltaRubric, een aanpak die multimodale preferentie-evaluatie herformuleert als een plannings- en uitvoeringsproces binnen één enkele MLLM. DeltaRubric werkt in twee stappen: eerst fungeert het model als een Discrepantieplanner en genereert het een neutrale, instantie-specifieke verificatiechecklist. Vervolgens schakelt het over naar een Checklistverificateur, waarbij het deze zelf gegenereerde controles uitvoert op de afbeelding en vraag om tot een gefundeerd oordeel te komen. We formuleren DeltaRubric als een multi-rol reinforcement learning-probleem, waarbij we de plannings- en verificatiecapaciteiten gezamenlijk optimaliseren. Geverifieerd op Qwen3-VL 4B- en 8B Instruct-modellen behaalt DeltaRubric solide empirische winst. Op VL-RewardBench bijvoorbeeld verbetert het de algehele nauwkeurigheid van het basismodel met +22,6 (4B) en +18,8 (8B) punten, waarmee het de standaard baseline zonder rubric ruimschoots overtreft. De resultaten tonen aan dat het opsplitsen van evaluatie in gestructureerde, verifieerbare stappen leidt tot betrouwbaardere en beter generaliseerbare multimodale beloningsmodellering.
English
Aligning Multimodal Large Language Models (MLLMs) requires reliable reward models, yet existing single-step evaluators can suffer from lazy judging, exploiting language priors over fine-grained visual verification. While rubric-based evaluation mitigates these biases in text-only settings, extending it to multimodal tasks is bottlenecked by the complexity of visual reasoning. The critical differences between responses often depend on instance-specific visual details. Robust evaluation requires dynamically synthesizing rubrics that isolate spatial and factual discrepancies. To address this, we introduce DeltaRubric, an approach that reformulates multimodal preference evaluation as a plan-and-execute process within a single MLLM. DeltaRubric operates in two steps: acting first as a Disagreement Planner, the model generates a neutral, instance-specific verification checklist. Transitioning into a Checklist Verifier, it executes these self-generated checks against the image and question to produce the final grounded judgment. We formulate DeltaRubric as a multi-role reinforcement learning problem, jointly optimizing planning and verification capabilities. Validated on Qwen3-VL 4B and 8B Instruct models, DeltaRubric achieves solid empirical gains. For instance, On VL-RewardBench, it improves base model overall accuracy by +22.6 (4B) and +18.8 (8B) points, largely outperforming standard no-rubric baselines. The results demonstrate that decomposing evaluation into structured, verifiable steps leads to more reliable and generalizable multimodal reward modeling.