UP: Неограниченная положительная асимметричная оптимизация для преодоления дилеммы исследования и стабильности
UP: Unbounded Positive Asymmetric Optimization for Breaking the Exploration-Stability Dilemma
July 8, 2026
Авторы: Chongyu Fan, Pengfei Liu, Jingjia Huang, Sijia Liu, Yi Lin
cs.AI
Аннотация
Обучение с подкреплением (RL) стало стандартной парадигмой для улучшения сложных способностей к рассуждению больших языковых моделей (LLM). Для достижения эффективности выборки современные фреймворки RL полагаются на выборку по важности (IS). Однако такие алгоритмы страдают от дилеммы между исследованием и стабильностью. Чистая IS часто приводит к катастрофической нестабильности обучения, в то время как стандартные механизмы клиппирования, используемые для смягчения этой нестабильности, строго ограничивают бюджет обновления политики. Формализуя понятие емкости вероятности (Cap), мы показываем, что консервативное клиппирование структурно подавляет исследование, преждевременно урезая бюджет обновления для правильных, но маловероятных путей рассуждения. Чтобы выйти за рамки этих ограничений, мы предлагаем Неограниченную Положительную Асимметричную Оптимизацию (UP) — универсальную и готовую к внедрению целевую функцию. UP теоретически перестраивает процесс оптимизации, фиксируя политику относительно ее текущего состояния с помощью оператора остановки градиента. Такая асимметричная конструкция открывает неограниченные стабильные градиенты для положительных преимуществ, чтобы максимизировать исследование, сохраняя при этом стандартные средства защиты клиппирования для отрицательных преимуществ во избежание нестабильности обучения. Кроме того, наша формулировка легко расширяется на различные гранулярности оптимизации, включая токен-уровневые (GRPO, DAPO) и последовательностные (GSPO) фреймворки. Обширные эксперименты показывают, что UP повышает способность к исследованию и обеспечивает превосходную точность рассуждений в различных алгоритмах RL (DAPO, GSPO, GRPO), архитектурах моделей (плотные, MoE и языково-визуальные) и режимах обучения (языковой и мультимодальный), подтверждая UP как действительно универсальное и готовое к внедрению улучшение для обучения на основе RL.
English
Reinforcement learning (RL) has become the standard paradigm for enhancing the complex reasoning capabilities of large language models (LLMs). To achieve sample efficiency, modern RL frameworks rely on importance sampling (IS). However, these algorithms suffer from an exploration-stability dilemma. Pure IS often leads to catastrophic training instability, while standard clipping mechanisms used to mitigate this instability strictly constrain the policy update budget. By formalizing the concept of Probability Capacity (Cap), we reveal that conservative clipping structurally stifles exploration by prematurely truncating the update budget for correct but low-confidence reasoning paths. To break free from these constraints, we propose Unbounded Positive Asymmetric Optimization (UP), a universal and plug-and-play objective. UP theoretically restructures the optimization process by anchoring the policy to its current state via the stop-gradient operator. This asymmetric design unleashes unclipped, stable gradients for positive advantages to maximize exploration, while maintaining standard clipping safeguards for negative advantages to prevent training instability. Furthermore, our formulation readily extends across different optimization granularities, including token-level (GRPO, DAPO) and sequence-level (GSPO) frameworks. Extensive experiments demonstrate that UP enhances exploration capacity and achieves superior reasoning accuracy across diverse RL algorithms (DAPO, GSPO, and GRPO), model architectures (Dense, MoE, and vision-language), and training modalities (language and multimodal), validating UP as a truly universal plug-and-play enhancement for RL-based training.