RubricEM: Meta-RL com Decomposição de Política Guiada por Rubrica para Além de Recompensas Verificáveis
RubricEM: Meta-RL with Rubric-guided Policy Decomposition beyond Verifiable Rewards
May 11, 2026
Autores: Gaotang Li, Bhavana Dalvi Mishra, Zifeng Wang, Jun Yan, Yanfei Chen, Chun-Liang Li, Long T. Le, Rujun Han, George Lee, Hanghang Tong, Chen-Yu Lee, Tomas Pfister
cs.AI
Resumo
Treinar agentes de pesquisa profunda, ou seja, sistemas que planejam, buscam, avaliam evidências e sintetizam relatórios extensos, leva o aprendizado por reforço para além do regime de recompensas verificáveis. Suas saídas carecem de respostas de referência, suas trajetórias abrangem muitas decisões aumentadas por ferramentas, e o pós-treinamento padrão oferece pouco mecanismo para transformar tentativas passadas em experiência reutilizável. Neste trabalho, defendemos que rubricas devem servir não apenas como avaliadores de respostas finais, mas como a interface compartilhada que estrutura a execução de políticas, o feedback do juiz e a memória do agente. Com base nessa visão, apresentamos o RubricEM, uma estrutura de aprendizado por reforço guiada por rubricas que combina decomposição gradual de políticas com evolução de metapolítica baseada em reflexão. O RubricEM primeiro torna as trajetórias de pesquisa conscientes de etapas, condicionando planejamento, coleta de evidências, revisão e síntese a rubricas autogeradas. Em seguida, atribui crédito com o GRPO Estruturado por Etapas, que usa julgamentos graduais de rubricas para fornecer feedback semântico mais denso para otimização de longo horizonte. Paralelamente, o RubricEM treina uma metapolítica de reflexão com espinha dorsal compartilhada que destila trajetórias julgadas em orientação reutilizável, baseada em rubricas, para tentativas futuras. O RubricEM-8B resultante alcança desempenho robusto em quatro referências de pesquisa de longo formato, superando modelos abertos comparáveis e se aproximando de sistemas proprietários de pesquisa profunda. Além do desempenho final, realizamos análises aprofundadas para compreender os ingredientes-chave do RubricEM.
English
Training deep research agents, namely systems that plan, search, evaluate evidence, and synthesize long-form reports, pushes reinforcement learning beyond the regime of verifiable rewards. Their outputs lack ground-truth answers, their trajectories span many tool-augmented decisions, and standard post-training offers little mechanism for turning past attempts into reusable experience. In this work, we argue that rubrics should serve not merely as final-answer evaluators, but as the shared interface that structures policy execution, judge feedback, and agent memory. Based on this view, we introduce RubricEM, a rubric-guided reinforcement learning framework that combines stagewise policy decomposition with reflection-based meta-policy evolution. RubricEM first makes research trajectories stage-aware by conditioning planning, evidence gathering, review, and synthesis on self-generated rubrics. It then assigns credit with Stage-Structured GRPO, which uses stagewise rubric judgments to provide denser semantic feedback for long-horizon optimization. In parallel, RubricEM trains a shared-backbone reflection meta-policy that distills judged trajectories into reusable rubric-grounded guidance for future attempts. The resulting RubricEM-8B achieves strong performance across four long-form research benchmarks, outperforming comparable open models and approaching proprietary deep-research systems. Beyond final performance, we perform thorough analyses to understand the key ingredients of RubricEM.