DiPO : Optimisation de Politique par Perplexité Désentrelacée pour un Équilibre Granulaire entre Exploration et Exploitation
DiPO: Disentangled Perplexity Policy Optimization for Fine-grained Exploration-Exploitation Trade-Off
April 15, 2026
Auteurs: Xiaofan Li, Ming Yang, Zhiyuan Ma, Shichao Ma, Jintao Du, Yu Cheng, Weiqiang Wang, Zhizhong Zhang, Xin Tan, Yanyun Qu, Lizhuang Ma, Yuan Xie
cs.AI
Résumé
L'apprentissage par renforcement avec récompenses vérifiables (RLVR) a catalysé des avancées significatives dans les capacités de raisonnement des grands modèles de langage (LLM). Cependant, la gestion efficace du compromis entre exploration et exploitation reste un défi critique. Dans cet article, nous analysons exhaustivement le dilemme exploration-exploitation des échantillons extrêmement difficiles et faciles durant l'entraînement et proposons un nouveau mécanisme de compromis granulaire. Concrètement, nous introduisons une stratégie de dissociation de l'espace de perplexité qui divise l'espace des échantillons en sous-espaces distincts d'exploration (haute perplexité) et d'exploitation (basse perplexité, permettant ainsi d'identifier finement les échantillons nécessitant un compromis exploration-exploitation. Par la suite, nous proposons un mécanisme bidirectionnel d'allocation des récompenses avec un impact minimal sur les récompenses de vérification pour mettre en œuvre une exploration et une exploitation guidées par la perplexité, permettant une optimisation des politiques plus stable. Enfin, nous avons évalué notre méthode sur deux tâches principales : le raisonnement mathématique et l'appel de fonctions. Les résultats expérimentaux démontrent la supériorité de la méthode proposée et confirment son efficacité à améliorer les performances des LLM grâce à un compromis exploration-exploitation granulaire.
English
Reinforcement Learning with Verifiable Rewards (RLVR) has catalyzed significant advances in the reasoning capabilities of Large Language Models (LLMs). However, effectively managing the exploration and exploitation trade-off remains a critical challenge. In this paper, we fully analyze the exploration and exploitation dilemma of extremely hard and easy samples during the training and propose a new fine-grained trade-off mechanism. Concretely, we introduce a perplexity space disentangling strategy that divides the sample space into distinct exploration (high perplexity) and exploitation (low perplexity) subspaces, thereby mining fine-grained samples requiring exploration-exploitation trade-off. Subsequently, we propose a bidirectional reward allocation mechanism with a minimum impact on verification rewards to implement perplexity-guided exploration and exploitation, enabling more stable policy optimization. Finally, we have evaluated our method on two mainstream tasks: mathematical reasoning and function calling, and experimental results demonstrate the superiority of the proposed method, confirming its effectiveness in enhancing LLM performance by fine-grained exploration-exploitation trade-off.