ChatPaper.aiChatPaper

Однопрогонная асинхронная оптимизация для агентного обучения с подкреплением

Single-Rollout Asynchronous Optimization for Agentic Reinforcement Learning

July 8, 2026
Авторы: Zhenyu Hou, Yujiang Li, Jie Tang, Yuxiao Dong
cs.AI

Аннотация

Обучение с подкреплением (RL) приобретает всё большее значение для этапа пост-обучения больших языковых моделей (LLM). Ранее конвейеры RL для LLM были в основном синхронными и работали с пакетами данных, перемежая итерации, что неэффективно для долгосрочных агентных задач. В последнее время асинхронное обучение с подкреплением стало более эффективной альтернативой, позволяя обновлять модель по мере поступления результатов развёрток. Однако существующие системы асинхронного RL часто делают упор на пропускную способность, оставляя стабильность обучения и эффективность выполнения задач в значительной степени неизученными. Например, ключевой проблемой является то, что групповая выборка в широко используемой структуре GRPO не подходит для асинхронного агентного обучения. В данной статье мы представляем метод однопрогонной асинхронной оптимизации (SAO), предназначенный для решения проблем стабильности и off-policy в асинхронном RL. Для уменьшения off-policy эффектов и улучшения обобщения мы заменяем групповую выборку на однопрогонную, то есть используем один прогон на каждый запрос. Мы дополнительно улучшаем эту стратегию однопрогонной выборки с помощью практических схем обучения модели ценности. Для повышения стабильности оптимизации мы вводим строгую двустороннюю стратегию клиппирования на уровне токенов. SAO способен стабильно обучаться в течение тысячи шагов и стабильно превосходить GRPO и его варианты на агентных задачах кодирования и рассуждения, таких как SWE-Bench Verified, BeyondAIME и IMOAnswerBench. Мы также демонстрируем, что однопрогонное RL особенно эффективно в условиях симулированного онлайн-обучения, где модель должна адаптироваться к изменяющейся эволюционирующей среде. В результате SAO успешно внедрён в агентный конвейер RL для обучения открытой модели GLM-5.2 (750B-A40B).
English
Reinforcement learning (RL) is becoming increasingly important for post-training large language models (LLMs). Previous RL pipelines for LLMs were mostly synchronous and batch-interleaved, which is inefficient for long-horizon agentic tasks. Recently, asynchronous RL has emerged as a more efficient alternative by updating the model as rollouts arrive. However, existing asynchronous RL systems often emphasize throughput, while leaving training stability and task effectiveness largely underexplored. For example, a key challenge is that group-wise sampling in the widely-used GRPO framework does not naturally fit asynchronous agentic training. In this paper, we present Single-rollout Asynchronous Optimization (SAO) to address the stability and off-policy challenges in asynchronous RL. To reduce off-policy effects and improve generalization, we replace group-wise sampling with single-rollout sampling, that is, using one rollout per prompt. We further improve this single-rollout strategy with practical value-model training designs. To improve optimization stability, we introduce a strict double-side token-level clipping strategy. SAO is able to train stably for one thousand steps and consistently outperform GRPO and its variants on agentic coding and reasoning benchmarks, such as SWE-Bench Verified, BeyondAIME, and IMOAnswerBench. We also demonstrate that single-rollout RL is particularly effective in a simulated online learning setting, where the model must adapt to changing evolving environments. To this end, SAO is successfully deployed in the agentic RL pipeline for training the open GLM-5.2 model (750B-A40B).