RUBRIC-ARROW : Modélisation alternée des récompenses par grille d’évaluation ponctuelle pour le post-entraînement des LLM dans des domaines non vérifiables
RUBRIC-ARROW: Alternating Pointwise Rubric Reward Modeling for LLM Post-training in Non-verifiable Domains
May 27, 2026
Auteurs: Haoxiang Jiang, Zihan Dong, Tianci Liu, Wanying Wang, Ran Xu, Tony Yu, Linjun Zhang, Haoyu Wang
cs.AI
Résumé
La modélisation ponctuelle des récompenses fournit des signaux critiques pour le post-entraînement des LLM, mais peine à évaluer de manière absolue dans des contextes subjectifs et non vérifiables. Les méthodes basées sur des grilles d'évaluation répondent à cela en décomposant l'évaluation en critères explicites, mais les approches existantes dépendent généralement de LLM de pointe et souffrent d'égalités causées par une agrégation booléenne stricte. Nous présentons RUBRIC-ARROW, un cadre alterné qui entraîne conjointement un générateur de grilles et un juge conditionné par ces grilles, dont l'étape d'apprentissage par renforcement n'utilise que des données de préférence par paires. Notre méthode associe une règle de score probabiliste qui réduit les égalités avec des récompenses basées sur la préférence propres à chaque phase, et un schéma GRPO alterné qui entraînent ensemble l'évaluateur ponctuel. Des expériences approfondies montrent que RUBRIC-ARROW atteint une précision compétitive de modélisation des récompenses et produit des gains constants pour le post-entraînement aval des politiques.
English
Pointwise reward modeling offers critical signals for LLM post-training, yet struggles with absolute scoring in subjective, non-verifiable settings. Rubric-based methods address this by decomposing evaluation into explicit criteria, but existing approaches typically depend on frontier LLMs and suffer from ties caused by hard Boolean aggregation. We present RUBRIC-ARROW, an alternating framework that jointly trains a rubric generator and a rubric-conditioned judge, with its RL stage using only pairwise preference data. Our method couples a probability-based scoring rule that reduces ties with phase-specific preference-based rewards and an alternating GRPO scheme that together train the pointwise evaluator. Extensive experiments show that RUBRIC-ARROW achieves competitive reward-modeling accuracy and yields consistent gains for downstream policy post-training.