ChatPaper.aiChatPaper

ThoughtFold : Repliement des chaînes de raisonnement via l'apprentissage introspectif de préférences

ThoughtFold: Folding Reasoning Chains via Introspective Preference Learning

June 2, 2026
Auteurs: Ziyan Liu, Xueda Shen, Yuzhe Gu, Songyang Gao, Kuikun Liu, Guangran Cheng, Chengqi Lyu, Dahua Lin, Wenwei Zhang, Kai Chen
cs.AI

Résumé

Les modèles de raisonnement à grande échelle (LRM) ont réalisé des progrès remarquables grâce à l'apprentissage par renforcement avec récompenses vérifiables (RLVR) sur les chaînes de pensée (CoT). Cependant, étant donné que les longues CoT contiennent naturellement des essais et erreurs et que les approches RLVR dominantes sélectionnent les trajectoires CoT correctes en termes de résultat pour la mémorisation, les explorations redondantes dans les longues CoT sont inévitablement renforcées, ce qui entraîne des problèmes de sur-réflexion chez les LRM. Les tentatives précédentes pour résoudre ce problème accordent principalement un avantage plus important aux trajectoires plus courtes, mais leurs signaux d'apprentissage sont toujours basés sur les résultats et ne peuvent pas réduire la mémorisation des explorations redondantes dans les longues CoT. Par conséquent, nous proposons ThoughtFold, un cadre qui exploite l'apprentissage par préférence à grain fin pour atténuer les explorations redondantes en vue d'un raisonnement efficace. ThoughtFold emploie une stratégie introspective pour identifier la redondance au sein de chaque trajectoire correcte, ce qui produit un spectre de sous-trajectoires candidates. En exploitant ce spectre, nous introduisons un objectif d'optimisation de préférence masquée qui pénalise explicitement les explorations redondantes et encourage le modèle à relier directement les segments de raisonnement essentiels, repliant efficacement ses chaînes de raisonnement en un chemin plus concis. Des expériences approfondies montrent que ThoughtFold améliore considérablement l'efficacité. Il réduit l'utilisation de jetons de DeepSeek-R1-Distill-Qwen-7B d'environ 56 % tout en maintenant une précision de pointe.
English
Large Reasoning Models (LRMs) have achieved remarkable progress thanks to Reinforcement Learning with Verifiable Rewards (RLVR) on Chain-of-Thoughts (CoTs). However, since long CoTs naturally contain trial and errors and mainstream RLVR approaches choose outcome-correct CoT trajectories for memorization, the redundant explorations in long CoTs are inevitably reinforced, which results in the over-thinking issues of LRMs. Previous attempts to resolve this issue mainly give more advantage to shorter trajectories, yet their learning signals are still outcome-based and cannot reduce the memorization of redundant explorations in long CoTs. Therefore, we propose ThoughtFold, a framework that leverages fine-grained preference learning to mitigate redundant explorations for efficient reasoning. ThoughtFold employs an introspective strategy to identify redundancy within each correct trajectory, which yields a spectrum of candidate sub-trajectories. Leveraging this spectrum, we introduce a masked preference optimization objective that explicitly penalizes redundant explorations and encourages the model to directly bridge essential reasoning segments, effectively folding its reasoning chains into a more concise path. Extensive experiments show that ThoughtFold significantly enhances efficiency. It reduces the token usage of DeepSeek-R1-Distill-Qwen-7B by approximately 56% while maintaining state-of-the-art accuracy.