DeltaRubric : Modélisation de récompense multimodale générative via planification conjointe et vérification
DeltaRubric: Generative Multimodal Reward Modeling via Joint Planning and Verification
May 10, 2026
Auteurs: Rui Liu, Dian Yu, Zhenwen Liang, Yucheng Shi, Tong Zheng, Runpeng Dai, Haitao Mi, Pratap Tokekar, Leoweiliang
cs.AI
Résumé
L'alignement des Modèles de Langage Multimodaux de Grande Taille (MLLMs) nécessite des modèles de récompense fiables, mais les évaluateurs en une seule étape existants peuvent souffrir d'un jugement paresseux, exploitant les priors linguistiques au détriment d'une vérification visuelle fine. Bien que l'évaluation basée sur des grilles atténue ces biais dans les contextes purement textuels, son extension aux tâches multimodales est entravée par la complexité du raisonnement visuel. Les différences critiques entre les réponses dépendent souvent de détails visuels spécifiques à l'instance. Une évaluation robuste nécessite de synthétiser dynamiquement des grilles qui isolent les écarts spatiaux et factuels. Pour résoudre ce problème, nous introduisons DeltaRubric, une approche qui reformule l'évaluation des préférences multimodales comme un processus de planification et d'exécution au sein d'un seul MLLM. DeltaRubric fonctionne en deux étapes : agissant d'abord comme un Planificateur de Désaccord, le modèle génère une liste de vérification neutre et spécifique à l'instance. En passant ensuite en mode Vérificateur de Checklist, il exécute ces vérifications auto-générées sur l'image et la question pour produire le jugement final fondé. Nous formulons DeltaRubric comme un problème d'apprentissage par renforcement multi-rôle, optimisant conjointement les capacités de planification et de vérification. Validé sur les modèles Qwen3-VL 4B et 8B Instruct, DeltaRubric obtient des gains empiriques solides. Par exemple, sur VL-RewardBench, il améliore la précision globale du modèle de base de +22,6 points (4B) et +18,8 points (8B), surpassant largement les références standard sans grille. Les résultats démontrent que décomposer l'évaluation en étapes structurées et vérifiables conduit à une modélisation de récompense multimodale plus fiable et généralisable.
English
Aligning Multimodal Large Language Models (MLLMs) requires reliable reward models, yet existing single-step evaluators can suffer from lazy judging, exploiting language priors over fine-grained visual verification. While rubric-based evaluation mitigates these biases in text-only settings, extending it to multimodal tasks is bottlenecked by the complexity of visual reasoning. The critical differences between responses often depend on instance-specific visual details. Robust evaluation requires dynamically synthesizing rubrics that isolate spatial and factual discrepancies. To address this, we introduce DeltaRubric, an approach that reformulates multimodal preference evaluation as a plan-and-execute process within a single MLLM. DeltaRubric operates in two steps: acting first as a Disagreement Planner, the model generates a neutral, instance-specific verification checklist. Transitioning into a Checklist Verifier, it executes these self-generated checks against the image and question to produce the final grounded judgment. We formulate DeltaRubric as a multi-role reinforcement learning problem, jointly optimizing planning and verification capabilities. Validated on Qwen3-VL 4B and 8B Instruct models, DeltaRubric achieves solid empirical gains. For instance, On VL-RewardBench, it improves base model overall accuracy by +22.6 (4B) and +18.8 (8B) points, largely outperforming standard no-rubric baselines. The results demonstrate that decomposing evaluation into structured, verifiable steps leads to more reliable and generalizable multimodal reward modeling.