ChatPaper.aiChatPaper

Auto-distillation on-policy crosslingue pour le raisonnement multilingue

Crosslingual On-Policy Self-Distillation for Multilingual Reasoning

May 10, 2026
Auteurs: Yihong Liu, Raoyuan Zhao, Michael A. Hedderich, Hinrich Schütze
cs.AI

Résumé

Les grands modèles de langage (LLM) ont réalisé des progrès remarquables en raisonnement mathématique, mais cette capacité n'est pas également accessible dans toutes les langues. En particulier, les langues peu dotées affichent des performances de raisonnement bien inférieures. Pour y remédier, nous proposons la Distillation Autodirigée sur Politique Crosslingue (COPSD), qui transfère le comportement de raisonnement d'un modèle sur les langues riches vers les langues peu dotées. COPSD utilise le même modèle comme étudiant et comme enseignant : l'étudiant ne voit que le problème dans la langue peu dotée, tandis que l'enseignant reçoit un contexte crosslingue privilégié, comprenant la traduction du problème et la solution de référence en anglais. L'entraînement minimise la divergence au niveau des tokens sur l'ensemble de la distribution des déploiements propres de l'étudiant, fournissant ainsi une supervision dense tout en évitant la rareté et l'instabilité de l'apprentissage par renforcement (RL) basé uniquement sur les résultats. Des expériences menées sur 17 langues africaines peu dotées montrent que COPSD améliore systématiquement le raisonnement mathématique sur ces langues, quelle que soit la taille du modèle, et surpasse nettement l'Optimisation Relative de Politique par Groupe (GRPO). Des analyses supplémentaires montrent que COPSD améliore le respect du format de réponse, renforce le passage à l'échelle au moment du test et se généralise à des benchmarks de raisonnement multilingues plus difficiles, avec des gains particulièrement importants pour les langues les moins dotées. Nous mettons notre code et nos données à disposition à l'adresse : https://github.com/cisnlp/COPSD.
English
Large language models (LLMs) have achieved remarkable progress in mathematical reasoning, but this ability is not equally accessible across languages. Especially low-resource languages exhibit much lower reasoning performance. To address this, we propose Crosslingual On-Policy Self-Distillation (COPSD), which transfers a model's own high-resource reasoning behavior to low-resource languages. COPSD uses the same model as student and teacher: the student sees only the low-resource problem, while the teacher receives privileged crosslingual context, including the problem translation and reference solution in English. Training minimizes full-distribution token-level divergence on the student's own rollouts, providing dense supervision while avoiding the sparsity and instability of outcome-only reinforcement learning (RL). Experiments on 17 low-resource African languages show that COPSD consistently improves low-resource mathematical reasoning across model sizes and substantially outperforms Group Relative Policy Optimization (GRPO). Further analyses show that COPSD improves answer-format adherence, strengthens test-time scaling, and generalizes to harder multilingual reasoning benchmarks, with especially large gains for lower-resource languages. We make our code and data available at: https://github.com/cisnlp/COPSD.