ChatPaper.aiChatPaper

古くても安定:非同期強化学習を安定化するためのステイルネス適応型信頼領域

Stale but Stable: Staleness-Adaptive Trust Regions for Stabilizing Asynchronous Reinforcement Learning

July 21, 2026
著者: Junyao Yang, Yucheng Shi, Zongxia Li, Zhongzhi Li, Ruhan Wang, Xiangxin Zhou, Kishan Panaganti, Haitao Mi, Leowei Liang
cs.AI

要旨

非同期強化学習は、ロールアウト生成と最適化を分離することでスループットを向上させるが、ポリシーの遅れ、エンジンの遅延、混合専門家ルーティングによって悪化する陳腐化は不可避な副産物である。信頼領域の観点からは、この不一致は深刻である。学習と推論の乖離が有限地平線のバウンドにおける近似誤差を支配する一方、PPOクリッピングはサンプリングされた外側への更新のみを制限し、全ポリシー制約ではなくサンプリングされた代理関数として機能する。その結果、陳腐化したロールアウトが最も重大となる非同期設定では、高陳腐化更新の制御が弱いままとなる。 本稿では、陳腐化適応信頼領域(SAT)を導入する。これは、分離されたサンプリング対数比を実用的な陳腐化プロキシとして用い、陳腐化ベースのカーネルスケーリングにより各バッチ内の高不一致テールを特定し、名目PPO区間の符号選択された端点のみを縮約する。これにより、通常のトークンでは基本動作を維持しつつ、新たに捕捉された外側帯域ではより保守的な更新を強制する。我々は、PPOに対する局所区間包含と点ごとの悲観性を証明し、適応ルールが不均一な陳腐化下で更新幾何をどのように再形成するかを示す。 我々は、Qwen3-30B-A3B-Baseをベースとし、SGLangを推論エンジン、Megatronを学習に用いた分離型非同期RL設定においてSATを評価する。この設定で、SAT-GSPO w/ R3は最高のAIME24 avg@8を達成し、ラグ1で35.83、ラグ8で34.79となり、SAT-GSPOはラグ1で34.17となった。適応的クリッピングとルーティングリプレイは、それぞれ不一致テールとルーティングの不一致を対象とした相補的な安定化手法として機能する。全体として、クリッピング区間を陳腐化の不均一性と整合させることで、非同期RLを効果的に安定化できる。
English
Asynchronous reinforcement learning improves throughput by decoupling rollout generation from optimization, but staleness is an inevitable byproduct compounded by policy lag, engine delays, and mixture-of-experts routing. From a trust-region perspective, this mismatch is critical: training-inference divergence governs approximation error in finite-horizon bounds, whereas PPO clipping only gates sampled outward updates, acting as a sampled surrogate rather than a full-policy constraint. As a result, high-staleness updates remain weakly controlled in the asynchronous regime where stale rollouts matter most. We introduce the Staleness-Adaptive Trust Region (SAT), which uses the detached sampled log-ratio as a practical staleness proxy, identifies high-mismatch tails within each batch via staleness-based kernel scaling, and contracts only the sign-selected endpoint of the nominal PPO interval. This preserves baseline behavior on ordinary tokens while enforcing more conservative updates on newly intercepted outward bands. We prove local interval containment and pointwise pessimism relative to PPO, showing how the adaptive rule reshapes update geometry under heterogeneous staleness. We evaluate SAT in a decoupled asynchronous RL setup built on Qwen3-30B-A3B-Base, using SGLang as the inference engine and Megatron for training. In this setting, SAT-GSPO w/ R3 achieves the best observed AIME24 avg@8, reaching 35.83 at lag 1 and 34.79 at lag 8, while SAT-GSPO reaches 34.17 at lag 1. Adaptive clipping and routing replay act as complementary stabilizers targeting mismatch tails and routing inconsistency, respectively. Overall, aligning clip intervals with staleness heterogeneity effectively stabilizes asynchronous RL.