ChatPaper.aiChatPaper

RubricEM: Meta-RL met rubriek-gestuurde beleidsdecompositie voorbij verifieerbare beloningen

RubricEM: Meta-RL with Rubric-guided Policy Decomposition beyond Verifiable Rewards

May 11, 2026
Auteurs: Gaotang Li, Bhavana Dalvi Mishra, Zifeng Wang, Jun Yan, Yanfei Chen, Chun-Liang Li, Long T. Le, Rujun Han, George Lee, Hanghang Tong, Chen-Yu Lee, Tomas Pfister
cs.AI

Samenvatting

Het trainen van diepgaande onderzoeksagenten, dat wil zeggen systemen die plannen, zoeken, bewijsmateriaal evalueren en langdurige rapporten synthetiseren, brengt reinforcement learning buiten het domein van verifieerbare beloningen. Hun output mist grondwaarheidsantwoorden, hun trajecten omvatten veel tool-verrijkte beslissingen, en standaard post-training biedt weinig mechanisme om eerdere pogingen om te zetten in herbruikbare ervaring. In dit werk stellen we dat rubrieken niet alleen als eindantwoordevaluatoren moeten dienen, maar als de gedeelde interface die beleidsuitvoering, beoordelaarsfeedback en agentgeheugen structureert. Op basis van deze visie introduceren we RubricEM, een rubriekgestuurd reinforcement learning-raamwerk dat stapsgewijze beleidsdecompositie combineert met reflectiegebaseerde meta-beleidsevolutie. RubricEM maakt onderzoektrajecten eerst fasebewust door planning, bewijsverzameling, beoordeling en synthese te conditioneren op zelf gegenereerde rubrieken. Vervolgens kent het krediet toe met Fasegestructureerde GRPO, dat stapsgewijze rubriekbeoordelingen gebruikt om dichtere semantische feedback te geven voor optimalisatie over een lange horizon. Parallel hieraan traint RubricEM een gedeeld reflectie-meta-beleid dat beoordeelde trajecten destilleert in herbruikbare, rubriekgebaseerde richtlijnen voor toekomstige pogingen. De resulterende RubricEM-8B behaalt sterke prestaties op vier langlopende onderzoeksbenchmarks, presteert beter dan vergelijkbare open modellen en benadert propriëtaire diepgaande onderzoekssystemen. Naast de uiteindelijke prestaties voeren we grondige analyses uit om de belangrijkste ingrediënten van RubricEM te begrijpen.
English
Training deep research agents, namely systems that plan, search, evaluate evidence, and synthesize long-form reports, pushes reinforcement learning beyond the regime of verifiable rewards. Their outputs lack ground-truth answers, their trajectories span many tool-augmented decisions, and standard post-training offers little mechanism for turning past attempts into reusable experience. In this work, we argue that rubrics should serve not merely as final-answer evaluators, but as the shared interface that structures policy execution, judge feedback, and agent memory. Based on this view, we introduce RubricEM, a rubric-guided reinforcement learning framework that combines stagewise policy decomposition with reflection-based meta-policy evolution. RubricEM first makes research trajectories stage-aware by conditioning planning, evidence gathering, review, and synthesis on self-generated rubrics. It then assigns credit with Stage-Structured GRPO, which uses stagewise rubric judgments to provide denser semantic feedback for long-horizon optimization. In parallel, RubricEM trains a shared-backbone reflection meta-policy that distills judged trajectories into reusable rubric-grounded guidance for future attempts. The resulting RubricEM-8B achieves strong performance across four long-form research benchmarks, outperforming comparable open models and approaching proprietary deep-research systems. Beyond final performance, we perform thorough analyses to understand the key ingredients of RubricEM.