TRIAGE: Atribuição de Crédito Tipada por Papéis para Aprendizagem por Reforço Agentiva
TRIAGE: Role-Typed Credit Assignment for Agentic Reinforcement Learning
June 30, 2026
Autores: Yuanda Xu, Zhengze Zhou, Hejian Sang, Xiaomin Li, Jiaxin Zhang, Xinchen Du, Zhipeng Wang, Alborz Geramifard
cs.AI
Resumo
Aprendizagem por reforço agentiva requer atribuir crédito a ações voltadas ao ambiente, como buscas, cliques, edições, comandos de navegação e interações com objetos. O GRPO padrão utiliza o resultado final do verificador como uma vantagem uniforme sobre todos os tokens de ação. Esse sinal de resultado é útil, mas estruturalmente incompleto: ele penaliza a exploração útil em rollouts fracassados e reforça ações redundantes ou regressivas em rollouts bem-sucedidos. Propomos TRIAGE, um framework de atribuição de crédito com tipagem de papéis que adiciona um eixo de papéis semânticos ao crédito baseado em resultado. Um juiz estruturado classifica cada segmento como progresso decisivo, exploração útil, infraestrutura sem progresso ou regressão, e uma regra fixa condicionada ao papel mapeia esses rótulos para recompensas processuais limitadas no nível do segmento. Isso mantém os resultados do verificador como fonte de direção de otimização, enquanto corrige os dois principais pontos cegos do crédito baseado apenas em resultado. Mostramos ainda que o crédito condicionado ao papel é a correção ótima no nível do segmento expressável apenas a partir dos rótulos de papel — uma projeção do resíduo da vantagem por segmento na variável de papel —, de modo que as constantes de papel fixas reduzem o erro de estimativa da vantagem sempre que o juiz é confiável, e conectamos isso a gradientes de política de menor variância. Em ALFWorld, Search-QA e WebShop, o TRIAGE melhora as taxas de sucesso em relação ao GRPO para dois modelos de política e supera tanto uma recompensa processual derivada de juiz escalar quanto uma linha de base de valor compartilhado supervisionada por resultado. Ablações mostram que o ganho provém da tipagem de papéis, e não apenas da adição de recompensas densas: a detecção confiável de regressão dentro de trajetórias bem-sucedidas é o contribuidor dominante, enquanto o crédito de exploração fornece um ganho secundário consistente; em rollouts completos do ALFWorld e WebShop, o TRIAGE também reduz os turnos voltados ao ambiente em 10,4% e 14,8% adicionais em relação ao GRPO.
English
Agentic reinforcement learning requires assigning credit to environment-facing actions such as searches, clicks, edits, navigation commands, and object interactions. Standard GRPO uses the final verifier outcome as a uniform advantage over all action tokens. This outcome signal is useful but structurally incomplete: it punishes useful exploration in failed rollouts and reinforces redundant or regressive actions in successful rollouts. We propose TRIAGE, a role-typed credit assignment framework that adds a semantic role axis to outcome credit. A structured judge classifies each segment as decisive progress, useful exploration, no-progress infrastructure, or regression, and a fixed role-conditioned rule maps these labels to bounded segment-level process rewards. This keeps verifier outcomes as the source of optimization direction while correcting the two main blind spots of outcome-only credit. We further show that role-conditioned credit is the optimal segment-level correction expressible from role labels alone -- a projection of the per-segment advantage residual onto the role variable -- so that the fixed role constants reduce advantage estimation error whenever the judge is reliable, and we connect this to lower-variance policy gradients. Across ALFWorld, Search-QA, and WebShop, TRIAGE improves success rates over GRPO for two policy models and outperforms both a scalar judge-derived process reward and an outcome-supervised shared-backbone value baseline. Ablations show that the gain comes from role typing rather than merely adding dense rewards: reliable detection of regression inside successful trajectories is the dominant contributor, while exploration credit provides a consistent secondary gain; on completed ALFWorld and WebShop rollouts, TRIAGE also reduces environment-facing turns by an additional 10.4% and 14.8% relative to GRPO.