ユークリッドクリッピングを超えて:リーマン等長方策最適化によるLLM強化学習の探索崩壊の克服
Beyond Euclidean Clipping: Overcoming Exploration Collapse in LLM RL via Riemannian Isometric Policy Optimization
July 11, 2026
著者: Zhicheng Cai, Xinyuan Guo, Hanlin Wu, Mingxuan Wang, Wei-Ying Ma, Ya-Qin Zhang, Hao Zhou
cs.AI
要旨
強化学習(RL)は、大規模言語モデルの推論能力を向上させる主要なパラダイムとなっている。しかし、PPO-Clipを用いたRLアルゴリズムは、探索の崩壊という本質的な制約を抱えている。後続の研究は主にヒューリスティックな手法に留まり、PPO-Clipの失敗の根本原因を特定できていない。本研究では、PPO-Clipの根本的な欠陥を明らかにする。すなわち、PPO-Clipはユークリッド計量を用いて暗黙的に方策の不一致を測定しているが、これは方策リーマン多様体上の内在的幾何学と理論的に矛盾する。この幾何学的不整合により、低確率領域では過度に保守的な更新が、高確率領域では過度に積極的な更新が生じ、最終的に探索が崩壊する。この幾何学的欠陥を修正するため、我々はリーマン等角方策最適化(RIPO)を提案する。RIPOはリーマン多様体上で等角な方策更新を保証し、探索と活用のバランスを効果的に取る。さらに、RIPOがバイアスと分散の良好なトレードオフを達成し、最適化を安定化させることを示す。広範な実験により、RIPOが既存のLLM向けRLアルゴリズムを7つの競技ベンチマークで大幅に上回ることを実証する(AIME24ではGRPOと比較して最大60%の改善)。
English
Reinforcement learning (RL) has become a dominant paradigm for enhancing LLMs' reasoning capabilities. However, RL algorithms with PPO-Clip are inherently limited by exploration collapse. Subsequent works remain primarily heuristic and fail to identify the essential cause of PPO-Clip's failure. This work reveals the fundamental flaw of PPO-Clip: it implicitly measures policy discrepancy using Euclidean metric, which is theoretically inconsistent with the intrinsic geometry on the policy Riemannian manifold. This geometric mismatch results in overly conservative updates in low-probability regions while aggressive in high-probability regions, ultimately collapsing exploration. To correct this geometric flaw, we propose Riemannian Isometric Policy Optimization (RIPO), which guarantees isometric policy updates on the Riemannian manifold, effectively balancing exploration and exploitation. We further show that RIPO achieves a favorable bias-variance trade-off, which stabilizes optimization. Extensive experiments demonstrate that RIPO significantly surpasses existing LLM RL algorithms across seven competition-level benchmarks (up to 60% improvement over GRPO on AIME24).