Crosslinguale On-Policy Zelfdestillatie voor Meertalig Redeneren
Crosslingual On-Policy Self-Distillation for Multilingual Reasoning
May 10, 2026
Auteurs: Yihong Liu, Raoyuan Zhao, Michael A. Hedderich, Hinrich Schütze
cs.AI
Samenvatting
Grote taalmodellen (Large Language Models, LLM's) hebben opmerkelijke vooruitgang geboekt op het gebied van wiskundig redeneren, maar deze vaardigheid is niet in gelijke mate toegankelijk voor alle talen. Vooral talen met weinig bronnen vertonen een aanzienlijk lagere redeneerprestatie. Om dit aan te pakken, stellen we Crosslingual On-Policy Self-Distillation (COPSD) voor, dat het eigen redeneergedrag van een model in talen met veel bronnen overdraagt naar talen met weinig bronnen. COPSD gebruikt hetzelfde model als student en docent: de student krijgt alleen het probleem in de taal met weinig bronnen te zien, terwijl de docent geprivilegieerde crosslinguale context krijgt, inclusief de vertaling van het probleem en de referentie-oplossing in het Engels. De training minimaliseert de token-niveau divergentie van de volledige verdeling over de eigen rollouts van de student, wat dichte supervisie biedt en de schaarste en instabiliteit van op uitkomsten gebaseerde versterkingleren (reinforcement learning, RL) vermijdt. Experimenten op 17 Afrikaanse talen met weinig bronnen tonen aan dat COPSD consequent het wiskundig redeneren in talen met weinig bronnen verbetert, ongeacht de modelgrootte, en aanzienlijk beter presteert dan Group Relative Policy Optimization (GRPO). Verdere analyses laten zien dat COPSD de conformiteit met antwoordformaten verbetert, de schaling tijdens het testen versterkt en generaliseert naar moeilijkere meertalige redeneerbenchmarks, met name grote winsten voor talen met nog minder bronnen. We maken onze code en gegevens beschikbaar op: https://github.com/cisnlp/COPSD.
English
Large language models (LLMs) have achieved remarkable progress in mathematical reasoning, but this ability is not equally accessible across languages. Especially low-resource languages exhibit much lower reasoning performance. To address this, we propose Crosslingual On-Policy Self-Distillation (COPSD), which transfers a model's own high-resource reasoning behavior to low-resource languages. COPSD uses the same model as student and teacher: the student sees only the low-resource problem, while the teacher receives privileged crosslingual context, including the problem translation and reference solution in English. Training minimizes full-distribution token-level divergence on the student's own rollouts, providing dense supervision while avoiding the sparsity and instability of outcome-only reinforcement learning (RL). Experiments on 17 low-resource African languages show that COPSD consistently improves low-resource mathematical reasoning across model sizes and substantially outperforms Group Relative Policy Optimization (GRPO). Further analyses show that COPSD improves answer-format adherence, strengthens test-time scaling, and generalizes to harder multilingual reasoning benchmarks, with especially large gains for lower-resource languages. We make our code and data available at: https://github.com/cisnlp/COPSD.