ChatPaper.aiChatPaper

Optimisation asynchrone à rollout unique pour l'apprentissage par renforcement agentique

Single-Rollout Asynchronous Optimization for Agentic Reinforcement Learning

July 8, 2026
Auteurs: Zhenyu Hou, Yujiang Li, Jie Tang, Yuxiao Dong
cs.AI

Résumé

L'apprentissage par renforcement (RL) joue un rôle de plus en plus important dans le post-entraînement des grands modèles de langage (LLM). Les pipelines de RL antérieurs pour les LLM étaient principalement synchrones et basés sur un traitement par lots entrelacés, ce qui s'avère inefficace pour les tâches agentiques à long horizon. Récemment, le RL asynchrone est apparu comme une alternative plus efficace, permettant de mettre à jour le modèle au fur et à mesure de l'arrivée des déploiements (rollouts). Cependant, les systèmes de RL asynchrone existants mettent souvent l'accent sur le débit, tout en laissant largement inexplorées la stabilité de l'entraînement et l'efficacité des tâches. Par exemple, un défi clé réside dans le fait que l'échantillonnage par groupes, largement utilisé dans le cadre GRPO, ne s'intègre pas naturellement à l'entraînement agentique asynchrone. Dans cet article, nous présentons l'Optimisation Asynchrone à Déploiement Unique (SAO) pour relever les défis de stabilité et de hors-politique (off-policy) dans le RL asynchrone. Afin de réduire les effets hors-politique et d'améliorer la généralisation, nous remplaçons l'échantillonnage par groupes par un échantillonnage à déploiement unique, c'est-à-dire en utilisant un seul déploiement par prompt. Nous améliorons ensuite cette stratégie de déploiement unique avec des conceptions pratiques d'entraînement du modèle de valeur. Pour améliorer la stabilité de l'optimisation, nous introduisons une stratégie d'écrêtage (clipping) stricte au niveau des tokens, des deux côtés. SAO est capable de s'entraîner de manière stable pendant mille pas et surpasse systématiquement GRPO et ses variantes sur les benchmarks de codage agentique et de raisonnement, tels que SWE-Bench Verified, BeyondAIME et IMOAnswerBench. Nous démontrons également que le RL à déploiement unique est particulièrement efficace dans un cadre d'apprentissage en ligne simulé, où le modèle doit s'adapter à des environnements évolutifs changeants. À cette fin, SAO est déployé avec succès dans le pipeline RL agentique utilisé pour l'entraînement du modèle ouvert GLM-5.2 (750B-A40B).
English
Reinforcement learning (RL) is becoming increasingly important for post-training large language models (LLMs). Previous RL pipelines for LLMs were mostly synchronous and batch-interleaved, which is inefficient for long-horizon agentic tasks. Recently, asynchronous RL has emerged as a more efficient alternative by updating the model as rollouts arrive. However, existing asynchronous RL systems often emphasize throughput, while leaving training stability and task effectiveness largely underexplored. For example, a key challenge is that group-wise sampling in the widely-used GRPO framework does not naturally fit asynchronous agentic training. In this paper, we present Single-rollout Asynchronous Optimization (SAO) to address the stability and off-policy challenges in asynchronous RL. To reduce off-policy effects and improve generalization, we replace group-wise sampling with single-rollout sampling, that is, using one rollout per prompt. We further improve this single-rollout strategy with practical value-model training designs. To improve optimization stability, we introduce a strict double-side token-level clipping strategy. SAO is able to train stably for one thousand steps and consistently outperform GRPO and its variants on agentic coding and reasoning benchmarks, such as SWE-Bench Verified, BeyondAIME, and IMOAnswerBench. We also demonstrate that single-rollout RL is particularly effective in a simulated online learning setting, where the model must adapt to changing evolving environments. To this end, SAO is successfully deployed in the agentic RL pipeline for training the open GLM-5.2 model (750B-A40B).