ChatPaper.aiChatPaper

DeltaRubric: Modelagem Generativa de Recompensa Multimodal via Planejamento e Verificação Conjuntos

DeltaRubric: Generative Multimodal Reward Modeling via Joint Planning and Verification

May 10, 2026
Autores: Rui Liu, Dian Yu, Zhenwen Liang, Yucheng Shi, Tong Zheng, Runpeng Dai, Haitao Mi, Pratap Tokekar, Leoweiliang
cs.AI

Resumo

Alinhar Modelos de Linguagem Grandes Multimodais (MLLMs) requer modelos de recompensa confiáveis, mas avaliadores de etapa única existentes podem sofrer de julgamento preguiçoso, explorando prioridades linguísticas em detrimento da verificação visual refinada. Embora a avaliação baseada em rubricas mitigue esses vieses em contextos apenas de texto, estendê-la para tarefas multimodais é limitado pela complexidade do raciocínio visual. As diferenças críticas entre as respostas frequentemente dependem de detalhes visuais específicos da instância. Uma avaliação robusta requer a síntese dinâmica de rubricas que isolem discrepâncias espaciais e factuais. Para lidar com isso, apresentamos o DeltaRubric, uma abordagem que reformula a avaliação de preferência multimodal como um processo de planejamento e execução dentro de um único MLLM. O DeltaRubric opera em duas etapas: atuando primeiro como um Planejador de Discordância, o modelo gera uma lista de verificação neutra e específica da instância. Transicionando para um Verificador de Lista, ele executa essas verificações autogeradas em relação à imagem e à pergunta para produzir o julgamento final fundamentado. Formulamos o DeltaRubric como um problema de aprendizado por reforço de múltiplos papéis, otimizando conjuntamente as capacidades de planejamento e verificação. Validado nos modelos Qwen3-VL 4B e 8B Instruct, o DeltaRubric obtém ganhos empíricos sólidos. Por exemplo, no VL-RewardBench, ele melhora a precisão geral do modelo base em +22,6 (4B) e +18,8 (8B) pontos, superando amplamente as linhas de base padrão sem rubrica. Os resultados demonstram que decompor a avaliação em etapas estruturadas e verificáveis leva a uma modelagem de recompensa multimodal mais confiável e generalizável.
English
Aligning Multimodal Large Language Models (MLLMs) requires reliable reward models, yet existing single-step evaluators can suffer from lazy judging, exploiting language priors over fine-grained visual verification. While rubric-based evaluation mitigates these biases in text-only settings, extending it to multimodal tasks is bottlenecked by the complexity of visual reasoning. The critical differences between responses often depend on instance-specific visual details. Robust evaluation requires dynamically synthesizing rubrics that isolate spatial and factual discrepancies. To address this, we introduce DeltaRubric, an approach that reformulates multimodal preference evaluation as a plan-and-execute process within a single MLLM. DeltaRubric operates in two steps: acting first as a Disagreement Planner, the model generates a neutral, instance-specific verification checklist. Transitioning into a Checklist Verifier, it executes these self-generated checks against the image and question to produce the final grounded judgment. We formulate DeltaRubric as a multi-role reinforcement learning problem, jointly optimizing planning and verification capabilities. Validated on Qwen3-VL 4B and 8B Instruct models, DeltaRubric achieves solid empirical gains. For instance, On VL-RewardBench, it improves base model overall accuracy by +22.6 (4B) and +18.8 (8B) points, largely outperforming standard no-rubric baselines. The results demonstrate that decomposing evaluation into structured, verifiable steps leads to more reliable and generalizable multimodal reward modeling.