Sur la confusion liée à la longueur des étapes dans la sélection des données de raisonnement des LLM
On the Step Length Confounding in LLM Reasoning Data Selection
April 8, 2026
Auteurs: Bing Wang, Rui Miao, Chen Shen, Shaotian Yan, Kaiyuan Liu, Ximing Li, Xiaosong Yuan, Sinan Fan, Jun Zhang, Jieping Ye
cs.AI
Résumé
Les grands modèles de raisonnement ont récemment démontré des performances remarquables sur des tâches complexes nécessitant un enchaînement de raisonnements étendus, grâce à un affinage supervisé sur des jeux de données à grande échelle et de haute qualité. Pour construire de tels ensembles de données, les pipelines existants génèrent des données de raisonnement longues à partir de modèles de langage plus performants et appliquent des méthodes de sélection heuristiques manuelles ou basées sur la naturalité pour filtrer les échantillons de qualité. Bien que l'efficacité de la sélection de données basée sur la naturalité - qui classe les données selon la probabilité logarithmique moyenne attribuée par les modèles de langage - soit avérée, notre analyse révèle qu'appliquée aux jeux de données de raisonnement, cette méthode privilégie systématiquement les échantillons avec des étapes de raisonnement plus longues (c'est-à-dire plus de tokens par étape) plutôt que ceux de meilleure qualité, un phénomène que nous nommons la confusion liée à la longueur des étapes. Par une analyse quantitative, nous attribuons ce phénomène aux faibles probabilités des premiers tokens dans les étapes de raisonnement ; les étapes plus longues diluent leur influence, augmentant ainsi artificiellement les probabilités logarithmiques moyennes. Pour résoudre ce problème, nous proposons deux méthodes variantes : ASLEC-DROP, qui ignore les probabilités des premiers tokens lors du calcul de la probabilité logarithmique moyenne, et ASLEC-CASL, qui applique une régression de débruitage causal pour supprimer l'effet confondant des premiers tokens. Des expériences menées sur quatre modèles de langage et cinq benchmarks d'évaluation démontrent l'efficacité de notre approche pour atténuer le problème de confusion liée à la longueur des étapes.
English
Large reasoning models have recently demonstrated strong performance on complex tasks that require long chain-of-thought reasoning, through supervised fine-tuning on large-scale and high-quality datasets. To construct such datasets, existing pipelines generate long reasoning data from more capable Large Language Models (LLMs) and apply manually heuristic or naturalness-based selection methods to filter high-quality samples. Despite the proven effectiveness of naturalness-based data selection, which ranks data by the average log probability assigned by LLMs, our analysis shows that, when applied to LLM reasoning datasets, it systematically prefers samples with longer reasoning steps (i.e., more tokens per step) rather than higher-quality ones, a phenomenon we term step length confounding. Through quantitative analysis, we attribute this phenomenon to low-probability first tokens in reasoning steps; longer steps dilute their influence, thereby inflating the average log probabilities. To address this issue, we propose two variant methods: ASLEC-DROP, which drops first-token probabilities when computing average log probability, and ASLEC-CASL, which applies a causal debiasing regression to remove the first tokens' confounding effect. Experiments across four LLMs and five evaluation benchmarks demonstrate the effectiveness of our approach in mitigating the step length confounding problem.