Almoço Grátis Negligenciado do Pós-treinamento: Vantagem de Progresso para Agentes LLM
Neglected Free Lunch from Post-training: Progress Advantage for LLM Agents
June 24, 2026
Autores: Changdae Oh, Wendi Li, Seongheon Park, Samuel Yeh, Tanwi Mallick, Sharon Li
cs.AI
Resumo
Modelos de recompensa de processo permitem uma avaliação granular em nível de etapa dos LLMs, mas construí-los para configurações agentivas continua proibitivamente difícil: interações de longo horizonte, ações irreversíveis e feedback estocástico do ambiente tornam tanto a anotação humana quanto a estimativa de Monte Carlo inviáveis em escala. Neste trabalho, mostramos que o pós-treinamento por aprendizado por reforço (RL) já fornece os ingredientes para uma pontuação eficaz em nível de etapa, eliminando a necessidade de treinamento dedicado de modelos de recompensa. Concretamente, derivamos uma vantagem implícita sob um processo de decisão de Markov estocástico geral, a qual denominamos vantagem de progresso — a razão de log-probabilidade entre a política treinada por RL e sua política de referência recupera exatamente a função de vantagem ótima. Essa formulação torna o sinal resultante livre de anotação, agnóstico a domínio e disponível como subproduto do pipeline padrão de pós-treinamento por RL. Validamos a eficácia da vantagem de progresso em três aplicações distintas: escalonamento em tempo de teste, quantificação de incerteza e atribuição de falhas em cinco benchmarks e quatro famílias de modelos. Em todos os cenários, ela supera consistentemente as baselines baseadas em confiança e, apesar de não exigir treinamento específico para a tarefa, ultrapassa modelos de recompensa treinados dedicados. Complementamos esses resultados com análises mais aprofundadas sobre as características da vantagem de progresso, oferecendo orientações práticas para adoção em sistemas agentivos do mundo real.
English
Process reward models enable fine-grained, step-level evaluation of LLMs, yet building them for agentic settings remains prohibitively difficult: long-horizon interactions, irreversible actions, and stochastic environment feedback make both human annotation and Monte Carlo estimation infeasible at scale. In this work, we show that reinforcement learning (RL) post-training already provides the ingredients for effective step-level scoring, eliminating the need for dedicated reward model training altogether. Concretely, we derive an implicit advantage under a general stochastic Markov decision process, which we term progress advantage -- log-probability ratio between the RL-trained policy and its reference policy exactly recovers the optimal advantage function. This formulation makes the resulting signal annotation-free, domain-agnostic, and available as a byproduct of the standard RL post-training pipeline. We validate the effectiveness of the progress advantage across three different applications: test-time scaling, uncertainty quantification, and failure attribution on five benchmarks and four model families. Across all settings, it consistently outperforms confidence-based baselines and, despite requiring no task-specific training, surpasses dedicated trained reward models. We complement these results with deeper analyses on characteristics of progress advantage, offering practical guidance for adoption in real-world agentic systems.