Coupez vos pertes ! Apprendre à élaguer précocement les chemins pour un raisonnement parallèle efficace
Cut Your Losses! Learning to Prune Paths Early for Efficient Parallel Reasoning
April 17, 2026
Auteurs: Jiaxi Bi, Tongxu Luo, Wenyu Du, Zhengyang Tang, Benyou Wang
cs.AI
Résumé
Le raisonnement parallèle améliore les modèles de raisonnement à grande échelle (LRM) mais entraîne des coûts prohibitifs dus aux chemins futiles causés par des erreurs précoces. Pour y remédier, l’élagage des chemins au niveau du préfixe est essentiel, mais les recherches existantes restent fragmentées sans cadre standardisé. Dans ce travail, nous proposons la première taxonomie systématique de l’élagage de chemins, catégorisant les méthodes selon leur source de signal (interne vs externe) et leur capacité d’apprentissage (apprenable vs non-apprenable). Cette classification révèle le potentiel inexploré des méthodes internes apprenables, motivant notre proposition de STOP (Super Token pour l’Élagage). Des évaluations approfondies sur des LRM allant de 1,5 à 20 milliards de paramètres démontrent que STOP atteint une efficacité et une efficience supérieures aux méthodes de référence existantes. De plus, nous validons rigoureusement l’évolutivité de STOP sous différents budgets de calcul – par exemple, en améliorant la précision de GPT-OSS-20B sur AIME25 de 84 % à près de 90 % avec un budget de calcul fixe. Enfin, nous synthétisons nos résultats en des directives empiriques formalisées pour faciliter un déploiement optimal en conditions réelles. Le code, les données et les modèles sont disponibles à l’adresse https://bijiaxihh.github.io/STOP.
English
Parallel reasoning enhances Large Reasoning Models (LRMs) but incurs prohibitive costs due to futile paths caused by early errors. To mitigate this, path pruning at the prefix level is essential, yet existing research remains fragmented without a standardized framework. In this work, we propose the first systematic taxonomy of path pruning, categorizing methods by their signal source (internal vs. external) and learnability (learnable vs. non-learnable). This classification reveals the unexplored potential of learnable internal methods, motivating our proposal of STOP (Super TOken for Pruning). Extensive evaluations across LRMs ranging from 1.5B to 20B parameters demonstrate that STOP achieves superior effectiveness and efficiency compared to existing baselines. Furthermore, we rigorously validate the scalability of STOP under varying compute budgets - for instance, boosting GPT-OSS-20B accuracy on AIME25 from 84% to nearly 90% under fixed compute budgets. Finally, we distill our findings into formalized empirical guidelines to facilitate optimal real-world deployment. Code, data and models are available at https://bijiaxihh.github.io/STOP