ChatPaper.aiChatPaper

UP: Optimización Asimétrica Positiva Ilimitada para Romper el Dilema de Exploración-Estabilidad

UP: Unbounded Positive Asymmetric Optimization for Breaking the Exploration-Stability Dilemma

July 8, 2026
Autores: Chongyu Fan, Pengfei Liu, Jingjia Huang, Sijia Liu, Yi Lin
cs.AI

Resumen

El aprendizaje por refuerzo (RL) se ha convertido en el paradigma estándar para mejorar las capacidades de razonamiento complejo de los modelos de lenguaje de gran escala (LLMs). Para lograr eficiencia muestral, los marcos modernos de RL se basan en el muestreo por importancia (IS). Sin embargo, estos algoritmos sufren de un dilema entre exploración y estabilidad. El IS puro a menudo conduce a una inestabilidad catastrófica en el entrenamiento, mientras que los mecanismos de recorte estándar utilizados para mitigar esta inestabilidad restringen estrictamente el presupuesto de actualización de la política. Al formalizar el concepto de Capacidad de Probabilidad (Cap), revelamos que el recorte conservador suprime estructuralmente la exploración al truncar prematuramente el presupuesto de actualización para rutas de razonamiento correctas pero con baja confianza. Para liberarnos de estas restricciones, proponemos la Optimización Asimétrica Positiva Sin Límite (UP), un objetivo universal y plug-and-play. UP reestructura teóricamente el proceso de optimización al anclar la política a su estado actual mediante el operador de detención de gradientes. Este diseño asimétrico libera gradientes estables y sin recorte para ventajas positivas con el fin de maximizar la exploración, mientras mantiene las protecciones de recorte estándar para ventajas negativas para prevenir la inestabilidad del entrenamiento. Además, nuestra formulación se extiende fácilmente a diferentes granularidades de optimización, incluyendo marcos a nivel de tokens (GRPO, DAPO) y a nivel de secuencias (GSPO). Experimentos extensos demuestran que UP mejora la capacidad de exploración y logra una precisión de razonamiento superior a través de diversos algoritmos de RL (DAPO, GSPO y GRPO), arquitecturas de modelos (Densa, MoE y visión-lenguaje) y modalidades de entrenamiento (lenguaje y multimodal), validando a UP como una mejora verdaderamente universal y plug-and-play para el entrenamiento basado en RL.
English
Reinforcement learning (RL) has become the standard paradigm for enhancing the complex reasoning capabilities of large language models (LLMs). To achieve sample efficiency, modern RL frameworks rely on importance sampling (IS). However, these algorithms suffer from an exploration-stability dilemma. Pure IS often leads to catastrophic training instability, while standard clipping mechanisms used to mitigate this instability strictly constrain the policy update budget. By formalizing the concept of Probability Capacity (Cap), we reveal that conservative clipping structurally stifles exploration by prematurely truncating the update budget for correct but low-confidence reasoning paths. To break free from these constraints, we propose Unbounded Positive Asymmetric Optimization (UP), a universal and plug-and-play objective. UP theoretically restructures the optimization process by anchoring the policy to its current state via the stop-gradient operator. This asymmetric design unleashes unclipped, stable gradients for positive advantages to maximize exploration, while maintaining standard clipping safeguards for negative advantages to prevent training instability. Furthermore, our formulation readily extends across different optimization granularities, including token-level (GRPO, DAPO) and sequence-level (GSPO) frameworks. Extensive experiments demonstrate that UP enhances exploration capacity and achieves superior reasoning accuracy across diverse RL algorithms (DAPO, GSPO, and GRPO), model architectures (Dense, MoE, and vision-language), and training modalities (language and multimodal), validating UP as a truly universal plug-and-play enhancement for RL-based training.