Optimización Asíncrona de un Solo Despliegue para el Aprendizaje por Refuerzo Basado en Agentes
Single-Rollout Asynchronous Optimization for Agentic Reinforcement Learning
July 8, 2026
Autores: Zhenyu Hou, Yujiang Li, Jie Tang, Yuxiao Dong
cs.AI
Resumen
El aprendizaje por refuerzo (AR) está adquiriendo una importancia creciente para el post-entrenamiento de modelos de lenguaje de gran escala (LLMs) . Los pipelines previos de AR para LLMs eran mayoritariamente sincrónicos y con intercalado por lotes, lo cual resulta ineficiente para tareas agentivas de horizonte temporal largo. Recientemente, el AR asíncrono ha surgido como una alternativa más eficiente al actualizar el modelo a medida que llegan los rollouts. Sin embargo, los sistemas asíncronos de AR existentes suelen enfatizar el rendimiento, dejando en gran medida inexplorados la estabilidad del entrenamiento y la efectividad en las tareas. Por ejemplo, un desafío clave es que el muestreo por grupos en el marco GRPO, ampliamente utilizado, no se ajusta de forma natural al entrenamiento asíncrono de tipo agentivo. En este artículo presentamos la Optimización Asíncrona de un Solo Rollout (SAO, por sus siglas en inglés) para abordar los desafíos de estabilidad y de fuera de política en el AR asíncrono. Para reducir los efectos fuera de política y mejorar la generalización, reemplazamos el muestreo por grupos con un muestreo de un solo rollout, es decir, utilizando un rollout por cada indicación (prompt). Mejoramos aún más esta estrategia de un solo rollout con diseños prácticos de entrenamiento del modelo de valor. Para mejorar la estabilidad de la optimización, introducimos una estrategia estricta de recorte a nivel de token en ambos lados. SAO es capaz de entrenarse de forma estable durante mil pasos y superar consistentemente a GRPO y sus variantes en benchmarks de codificación y razonamiento agentivos, como SWE-Bench Verified, BeyondAIME e IMOAnswerBench. También demostramos que el AR de un solo rollout es particularmente efectivo en un entorno de aprendizaje en línea simulado, donde el modelo debe adaptarse a entornos cambiantes y en evolución. Con este fin, SAO se despliega con éxito en el pipeline de AR agentivo para entrenar el modelo abierto GLM-5.2 (750B-A40B).
English
Reinforcement learning (RL) is becoming increasingly important for post-training large language models (LLMs). Previous RL pipelines for LLMs were mostly synchronous and batch-interleaved, which is inefficient for long-horizon agentic tasks. Recently, asynchronous RL has emerged as a more efficient alternative by updating the model as rollouts arrive. However, existing asynchronous RL systems often emphasize throughput, while leaving training stability and task effectiveness largely underexplored. For example, a key challenge is that group-wise sampling in the widely-used GRPO framework does not naturally fit asynchronous agentic training. In this paper, we present Single-rollout Asynchronous Optimization (SAO) to address the stability and off-policy challenges in asynchronous RL. To reduce off-policy effects and improve generalization, we replace group-wise sampling with single-rollout sampling, that is, using one rollout per prompt. We further improve this single-rollout strategy with practical value-model training designs. To improve optimization stability, we introduce a strict double-side token-level clipping strategy. SAO is able to train stably for one thousand steps and consistently outperform GRPO and its variants on agentic coding and reasoning benchmarks, such as SWE-Bench Verified, BeyondAIME, and IMOAnswerBench. We also demonstrate that single-rollout RL is particularly effective in a simulated online learning setting, where the model must adapt to changing evolving environments. To this end, SAO is successfully deployed in the agentic RL pipeline for training the open GLM-5.2 model (750B-A40B).