UP: Otimização Assimétrica Positiva Ilimitada para Quebrar o Dilema Exploração-Estabilidade
UP: Unbounded Positive Asymmetric Optimization for Breaking the Exploration-Stability Dilemma
July 8, 2026
Autores: Chongyu Fan, Pengfei Liu, Jingjia Huang, Sijia Liu, Yi Lin
cs.AI
Resumo
A aprendizagem por reforço (RL) tornou-se o paradigma padrão para aprimorar as capacidades de raciocínio complexo de grandes modelos de linguagem (LLMs). Para alcançar eficiência amostral, estruturas modernas de RL dependem da amostragem por importância (IS). No entanto, esses algoritmos sofrem de um dilema entre exploração e estabilidade. A IS pura frequentemente leva a uma instabilidade catastrófica no treinamento, enquanto mecanismos de clipping padrão usados para mitigar essa instabilidade restringem estritamente o orçamento de atualização da política. Ao formalizar o conceito de Capacidade de Probabilidade (Cap), revelamos que o clipping conservador sufoca estruturalmente a exploração ao truncar prematuramente o orçamento de atualização para caminhos de raciocínio corretos, mas de baixa confiança. Para romper essas restrições, propomos a Otimização Assimétrica Positiva Ilimitada (UP), um objetivo universal e plug-and-play. A UP reestrutura teoricamente o processo de otimização ao ancorar a política em seu estado atual por meio do operador stop-gradient. Esse design assimétrico libera gradientes estáveis e sem clipping para vantagens positivas, maximizando a exploração, enquanto mantém salvaguardas de clipping padrão para vantagens negativas, prevenindo instabilidade no treinamento. Além disso, nossa formulação se estende prontamente a diferentes granularidades de otimização, incluindo estruturas em nível de token (GRPO, DAPO) e em nível de sequência (GSPO). Experimentos extensos demonstram que a UP aumenta a capacidade de exploração e alcança precisão de raciocínio superior em diversos algoritmos de RL (DAPO, GSPO e GRPO), arquiteturas de modelo (Densa, MoE e visão-linguagem) e modalidades de treinamento (linguagem e multimodal), validando a UP como um aprimoramento verdadeiramente universal plug-and-play para treinamento baseado em RL.
English
Reinforcement learning (RL) has become the standard paradigm for enhancing the complex reasoning capabilities of large language models (LLMs). To achieve sample efficiency, modern RL frameworks rely on importance sampling (IS). However, these algorithms suffer from an exploration-stability dilemma. Pure IS often leads to catastrophic training instability, while standard clipping mechanisms used to mitigate this instability strictly constrain the policy update budget. By formalizing the concept of Probability Capacity (Cap), we reveal that conservative clipping structurally stifles exploration by prematurely truncating the update budget for correct but low-confidence reasoning paths. To break free from these constraints, we propose Unbounded Positive Asymmetric Optimization (UP), a universal and plug-and-play objective. UP theoretically restructures the optimization process by anchoring the policy to its current state via the stop-gradient operator. This asymmetric design unleashes unclipped, stable gradients for positive advantages to maximize exploration, while maintaining standard clipping safeguards for negative advantages to prevent training instability. Furthermore, our formulation readily extends across different optimization granularities, including token-level (GRPO, DAPO) and sequence-level (GSPO) frameworks. Extensive experiments demonstrate that UP enhances exploration capacity and achieves superior reasoning accuracy across diverse RL algorithms (DAPO, GSPO, and GRPO), model architectures (Dense, MoE, and vision-language), and training modalities (language and multimodal), validating UP as a truly universal plug-and-play enhancement for RL-based training.