PCSD:エージェント型強化学習における自己蒸留のための持続的一貫性
PCSD: Persistent Consistency for Self-Distillation in Agentic Reinforcement Learning
August 3, 2026
著者: Chunji Lv, Yangguang Wei, Junlin Liu, Yang Gao, Ming Liu, Xinming Wang, Jinyang Wu, Guoren Wang, Changsheng Li
cs.AI
要旨
大規模言語モデルエージェントは複雑な対話型タスクにおいて強い可能性を示しているが、その強化学習(RL)は、長いマルチターン軌跡が単一の結果レベルの信号しか受け取れないことから、疎な報酬によってしばしば妨げられる。オンポリシー自己蒸留(OPSD)は、特権的教師から密なトークンレベルの教師信号を提供するが、教師はすべての位置で信頼できるとは限らない。既存手法は一般に、ノイズに敏感な孤立したトークンレベルの不一致に依存するか、位置による変動を見落とす可能性のある共有ステップレベルの重みを割り当てる。我々は、教師を支持する信号の局所的な持続性からトークンレベルの蒸留重みを導出する持続的一貫性自己蒸留(PCSD)を提案する。PCSDは、適応的ウィンドウと指数減衰集約を組み合わせて持続的な相対的教師支持を捕捉し、トレンド認識変調を適用して局所的に減少する支持を減衰させ、シグモイドゲーティングによって連続的な重みを生成する。得られた目的関数はGRPOと共同で最適化され、密な教師ガイダンスと疎な環境フィードバックを組み合わせる。推論時スキルなしで、PCSDは両方のバックボーンにおいてすべてのベースラインの中で最高のALFWorld Overall結果を達成し、GRPOを15.6ポイントおよび13.3ポイント、SDARを6.2ポイントおよび5.5ポイント上回る。さらに、WebShopでは競争力を維持し、未見のALFWorld分割ではGRPOに対して15.8ポイントの向上を達成する。
English
Large language model agents have shown strong potential in complex interactive tasks, yet their reinforcement learning (RL) is often hindered by sparse rewards, as a long multi-turn trajectory may receive only a single outcome-level signal. On-policy self-distillation (OPSD) provides dense token-level supervision from a privileged teacher, but the teacher may not be reliable at every position. Existing methods commonly rely on isolated token-level discrepancies, which can be sensitive to noise, or assign a shared step-level weight that may overlook positional variation. We propose Persistent Consistency Self-Distillation (PCSD), which derives token-level distillation weights from the local persistence of teacher-favoring signals. PCSD combines adaptive windows with exponentially decayed aggregation to capture persistent relative teacher support, applies trend-aware modulation to attenuate locally declining support, and produces continuous weights through sigmoid gating. The resulting objective is jointly optimized with GRPO, combining dense teacher guidance with sparse environmental feedback. Without inference-time skills, PCSD achieves the best ALFWorld Overall results among all baselines on both backbones, exceeding GRPO by 15.6 and 13.3 points and SDAR by 6.2 and 5.5 points, while remaining competitive on WebShop and gaining 15.8 points over GRPO on unseen ALFWorld split.