ChatPaper.aiChatPaper

LEAD : Raisonnement adaptatif et dynamique efficace en longueur pour les grands modèles de langage

LEAD: Length-Efficient Adaptive and Dynamic Reasoning for Large Language Models

May 10, 2026
Auteurs: Songtao Wei, Yi Li, Zhikai Li, Xu Hu, Yuede Ji, Guanpeng Li, Feng Chen, Carl Yang, Zhichun Guo, Bingzhe Li
cs.AI

Résumé

Les grands modèles de raisonnement, tels qu'OpenAI o1 et DeepSeek-R1, tendent à devenir de plus en plus verbeux à mesure que leurs capacités de raisonnement s'améliorent. Ces trajectoires de Chaîne de Pensée (CoT) gonflées excèdent souvent ce que les problèmes sous-jacents exigent, gaspillant ainsi des ressources de calcul, de latence et de budget de contexte. Bien que l'introduction de récompenses basées sur l'efficacité de la longueur lors de l'apprentissage par renforcement offre un remède naturel, les méthodes existantes peinent à relever deux défis fondamentaux : l'équilibre optimal entre exactitude et efficacité est non stationnaire tout au long de l'entraînement, et les budgets de raisonnement intrinsèques varient considérablement selon les problèmes. Se fier à des poids de récompense statiques et à des contraintes globales de longueur impose inévitablement un compromis entre une précision dégradée et une compression non réalisée. Pour surmonter ces limitations, nous proposons LEAD (Raisonnement Adaptatif et Dynamique Économe en Longueur), une méthode qui remplace les heuristiques statiques par des mécanismes d'auto-adaptation en ligne. LEAD calibre dynamiquement le compromis exactitude-efficacité à chaque étape en utilisant une Instabilité à Échelle Potentielle, orientant la capacité d'optimisation vers le signal d'apprentissage le plus informatif. De plus, il estime en ligne une longueur cible adaptative par problème basée sur les rollouts corrects du modèle lui-même, appliquant une récompense symétrique d'efficacité qui pénalise à la fois la sur-réflexion et la sur-compression. Évalué sur cinq benchmarks de raisonnement mathématique, LEAD atteint la précision et le Score de Précision-Efficacité les plus élevés parmi les méthodes de raisonnement efficient entraînées par RL, tout en produisant des sorties nettement plus courtes que le modèle de base.
English
Large reasoning models, such as OpenAI o1 and DeepSeek-R1, tend to become increasingly verbose as their reasoning capabilities improve. These inflated Chain-of-Thought (CoT) trajectories often exceed what the underlying problems require, wasting compute, latency, and context budgets. While introducing length-based efficiency rewards during reinforcement learning offers a natural remedy, existing methods struggle with two fundamental challenges: the optimal balance between correctness and efficiency is non-stationary throughout training, and intrinsic reasoning budgets vary drastically across problems. Relying on static reward weights and global length constraints inevitably forces a compromise between degraded accuracy and unrealized compression. To overcome these limitations, we propose LEAD (Length-Efficient Adaptive and Dynamic reasoning), a method that replaces static heuristics with online, self-adaptive mechanisms. LEAD dynamically calibrates the correctness-efficiency trade-off at each step using a Potential-Scaled Instability, directing optimization capacity to the most informative learning signal. Furthermore, it estimates an adaptive per-problem target length online based on the model's own correct rollouts, applying a symmetric efficiency reward that penalizes both overthinking and over-compression. Evaluated on five mathematical reasoning benchmarks, LEAD achieves the highest accuracy and Accuracy-Efficiency Score among RL-trained efficient-reasoning methods while producing substantially shorter outputs than the base model.