Otimização Assíncrona com Único Rollout para Aprendizagem por Reforço Agêntica
Single-Rollout Asynchronous Optimization for Agentic Reinforcement Learning
July 8, 2026
Autores: Zhenyu Hou, Yujiang Li, Jie Tang, Yuxiao Dong
cs.AI
Resumo
A aprendizagem por reforço (RL) está se tornando cada vez mais importante para o pós-treinamento de modelos de linguagem de grande escala (LLMs). Pipelines anteriores de RL para LLMs eram predominantemente síncronos e com intercalação por lotes, o que é ineficiente para tarefas agentivas de longo horizonte. Recentemente, a RL assíncrona emergiu como uma alternativa mais eficiente ao atualizar o modelo à medida que os rollouts chegam. No entanto, os sistemas assíncronos de RL existentes frequentemente enfatizam a vazão, enquanto deixam a estabilidade do treinamento e a eficácia das tarefas amplamente inexploradas. Por exemplo, um desafio chave é que a amostragem por grupo, amplamente utilizada no framework GRPO, não se ajusta naturalmente ao treinamento agentivo assíncrono. Neste artigo, apresentamos a Otimização Assíncrona de Rollout Único (SAO) para lidar com os desafios de estabilidade e fora da política na RL assíncrona. Para reduzir os efeitos fora da política e melhorar a generalização, substituímos a amostragem por grupo pela amostragem de rollout único, ou seja, usando um rollout por prompt. Aprimoramos ainda essa estratégia de rollout único com projetos práticos de treinamento do modelo de valor. Para melhorar a estabilidade da otimização, introduzimos uma estratégia rigorosa de recorte bilateral em nível de token. A SAO é capaz de treinar de forma estável por mil passos e superar consistentemente o GRPO e suas variantes em benchmarks agentivos de codificação e raciocínio, como SWE-Bench Verified, BeyondAIME e IMOAnswerBench. Também demonstramos que a RL de rollout único é particularmente eficaz em um cenário simulado de aprendizado online, onde o modelo deve se adaptar a ambientes em evolução e mudança. Para esse fim, a SAO foi implantada com sucesso no pipeline de RL agentivo para treinar o modelo aberto GLM-5.2 (750B-A40B).
English
Reinforcement learning (RL) is becoming increasingly important for post-training large language models (LLMs). Previous RL pipelines for LLMs were mostly synchronous and batch-interleaved, which is inefficient for long-horizon agentic tasks. Recently, asynchronous RL has emerged as a more efficient alternative by updating the model as rollouts arrive. However, existing asynchronous RL systems often emphasize throughput, while leaving training stability and task effectiveness largely underexplored. For example, a key challenge is that group-wise sampling in the widely-used GRPO framework does not naturally fit asynchronous agentic training. In this paper, we present Single-rollout Asynchronous Optimization (SAO) to address the stability and off-policy challenges in asynchronous RL. To reduce off-policy effects and improve generalization, we replace group-wise sampling with single-rollout sampling, that is, using one rollout per prompt. We further improve this single-rollout strategy with practical value-model training designs. To improve optimization stability, we introduce a strict double-side token-level clipping strategy. SAO is able to train stably for one thousand steps and consistently outperform GRPO and its variants on agentic coding and reasoning benchmarks, such as SWE-Bench Verified, BeyondAIME, and IMOAnswerBench. We also demonstrate that single-rollout RL is particularly effective in a simulated online learning setting, where the model must adapt to changing evolving environments. To this end, SAO is successfully deployed in the agentic RL pipeline for training the open GLM-5.2 model (750B-A40B).