ChatPaper.aiChatPaper

UP : Optimisation asymétrique positive non bornée pour résoudre le dilemme exploration-stabilité

UP: Unbounded Positive Asymmetric Optimization for Breaking the Exploration-Stability Dilemma

July 8, 2026
Auteurs: Chongyu Fan, Pengfei Liu, Jingjia Huang, Sijia Liu, Yi Lin
cs.AI

Résumé

L’apprentissage par renforcement (RL) est devenu le paradigme standard pour améliorer les capacités de raisonnement complexes des grands modèles de langage (LLMs). Pour atteindre une efficacité d’échantillonnage, les frameworks RL modernes reposent sur l’échantillonnage d’importance (IS). Cependant, ces algorithmes souffrent d’un dilemme exploration-stabilité. L’IS pur conduit souvent à une instabilité catastrophique de l’apprentissage, tandis que les mécanismes de clipping standard utilisés pour atténuer cette instabilité contraignent strictement le budget de mise à jour de la politique. En formalisant le concept de Capacité de Probabilité (Cap), nous révélons que le clipping conservateur bride structurellement l’exploration en tronquant prématurément le budget de mise à jour pour les chemins de raisonnement corrects mais de faible confiance. Pour nous affranchir de ces contraintes, nous proposons l’Optimisation Asymétrique Positive Non Bornée (UP), un objectif universel et prêt à l’emploi (plug-and-play). UP restructure théoriquement le processus d’optimisation en ancrant la politique à son état actuel via l’opérateur d’arrêt de gradient. Cette conception asymétrique libère des gradients non clippés et stables pour les avantages positifs afin de maximiser l’exploration, tout en maintenant les garde-fous standard de clipping pour les avantages négatifs afin d’éviter l’instabilité de l’apprentissage. De plus, notre formulation s’étend aisément à différentes granularités d’optimisation, y compris les frameworks au niveau des tokens (GRPO, DAPO) et au niveau des séquences (GSPO). Des expériences approfondies montrent que UP améliore la capacité d’exploration et atteint une meilleure précision de raisonnement sur divers algorithmes RL (DAPO, GSPO et GRPO), architectures de modèles (dense, MoE et vision-langage) et modalités d’apprentissage (langage et multimodal), validant UP comme une véritable amélioration universelle prête à l’emploi pour l’apprentissage basé sur le RL.
English
Reinforcement learning (RL) has become the standard paradigm for enhancing the complex reasoning capabilities of large language models (LLMs). To achieve sample efficiency, modern RL frameworks rely on importance sampling (IS). However, these algorithms suffer from an exploration-stability dilemma. Pure IS often leads to catastrophic training instability, while standard clipping mechanisms used to mitigate this instability strictly constrain the policy update budget. By formalizing the concept of Probability Capacity (Cap), we reveal that conservative clipping structurally stifles exploration by prematurely truncating the update budget for correct but low-confidence reasoning paths. To break free from these constraints, we propose Unbounded Positive Asymmetric Optimization (UP), a universal and plug-and-play objective. UP theoretically restructures the optimization process by anchoring the policy to its current state via the stop-gradient operator. This asymmetric design unleashes unclipped, stable gradients for positive advantages to maximize exploration, while maintaining standard clipping safeguards for negative advantages to prevent training instability. Furthermore, our formulation readily extends across different optimization granularities, including token-level (GRPO, DAPO) and sequence-level (GSPO) frameworks. Extensive experiments demonstrate that UP enhances exploration capacity and achieves superior reasoning accuracy across diverse RL algorithms (DAPO, GSPO, and GRPO), model architectures (Dense, MoE, and vision-language), and training modalities (language and multimodal), validating UP as a truly universal plug-and-play enhancement for RL-based training.