ChatPaper.aiChatPaper

Autodestilação On-Policy Crosslinguística para Raciocínio Multilíngue

Crosslingual On-Policy Self-Distillation for Multilingual Reasoning

May 10, 2026
Autores: Yihong Liu, Raoyuan Zhao, Michael A. Hedderich, Hinrich Schütze
cs.AI

Resumo

Modelos de linguagem de grande escala (LLMs) alcançaram progressos notáveis no raciocínio matemático, mas essa capacidade não está igualmente disponível em todos os idiomas. Especialmente idiomas com poucos recursos apresentam desempenho de raciocínio muito inferior. Para resolver isso, propomos a Autodestilação On-Policy Multilíngue (Crosslingual On-Policy Self-Distillation, COPSD), que transfere o comportamento de raciocínio de alto recurso do próprio modelo para idiomas de baixo recurso. A COPSD utiliza o mesmo modelo como aluno e professor: o aluno vê apenas o problema de baixo recurso, enquanto o professor recebe contexto multilíngue privilegiado, incluindo a tradução do problema e a solução de referência em inglês. O treinamento minimiza a divergência em nível de token em toda a distribuição nos próprios rollouts do aluno, fornecendo supervisão densa e evitando a esparsidade e instabilidade do aprendizado por reforço (RL) baseado apenas no resultado. Experimentos em 17 idiomas africanos de baixo recurso mostram que a COPSD melhora consistentemente o raciocínio matemático em idiomas de baixo recurso em diferentes tamanhos de modelo e supera substancialmente a Otimização de Política Relativa em Grupo (Group Relative Policy Optimization, GRPO). Análises adicionais mostram que a COPSD melhora a adesão ao formato de resposta, fortalece a escalabilidade em tempo de teste e generaliza para benchmarks de raciocínio multilíngue mais difíceis, com ganhos especialmente grandes para idiomas de recursos ainda mais reduzidos. Disponibilizamos nosso código e dados em: https://github.com/cisnlp/COPSD.
English
Large language models (LLMs) have achieved remarkable progress in mathematical reasoning, but this ability is not equally accessible across languages. Especially low-resource languages exhibit much lower reasoning performance. To address this, we propose Crosslingual On-Policy Self-Distillation (COPSD), which transfers a model's own high-resource reasoning behavior to low-resource languages. COPSD uses the same model as student and teacher: the student sees only the low-resource problem, while the teacher receives privileged crosslingual context, including the problem translation and reference solution in English. Training minimizes full-distribution token-level divergence on the student's own rollouts, providing dense supervision while avoiding the sparsity and instability of outcome-only reinforcement learning (RL). Experiments on 17 low-resource African languages show that COPSD consistently improves low-resource mathematical reasoning across model sizes and substantially outperforms Group Relative Policy Optimization (GRPO). Further analyses show that COPSD improves answer-format adherence, strengthens test-time scaling, and generalizes to harder multilingual reasoning benchmarks, with especially large gains for lower-resource languages. We make our code and data available at: https://github.com/cisnlp/COPSD.