MOPD: Multi-Teacher On-Policy Destillatie voor Capaciteitsintegratie in LLM Post-Training
MOPD: Multi-Teacher On-Policy Distillation for Capability Integration in LLM Post-Training
June 29, 2026
Auteurs: Wenhan Ma, Jianyu Wei, Liang Zhao, Hailin Zhang, Bangjun Xiao, Lei Li, Qibin Yang, Bofei Gao, Yudong Wang, Rang Li, Jinhao Dong, Zhifang Sui, Fuli Luo
cs.AI
Samenvatting
Moderne grote taalmodellen (LLM's) vertrouwen op versterkend leren tijdens natraining om specifieke vaardigheden te verbeteren, maar het integreren van meerdere vaardigheden in één model blijft moeilijk. Bestaande methoden, zoals Off-Policy Finetune en Mix-RL, zijn ofwel inefficiënt of verliezen prestaties. In dit werk stellen we Multi-teacher On-Policy Distillation (MOPD) voor, een natrainingsparadigma voor het combineren van de vaardigheden van meerdere domein-RL-leraren: we voeren eerst per domein gespecialiseerd versterkend leren uit om een reeks domeinleraren te verkrijgen, en destilleren deze leraren vervolgens in de student op basis van zijn eigen rollouts. Dit elimineert blootstellingsbias en biedt een dicht optimalisatiesignaal. Op Qwen3-30B-A3B presteert MOPD beter dan Mix-RL, Cascade RL, Off-Policy Finetune en Param-Merge-baselines, en erft bijna alle vaardigheden van elke leraar. MOPD maakt ook parallelle, onafhankelijke ontwikkeling van domeinleraren mogelijk, waardoor de kruisdomeinkoppeling die typisch is voor multi-domein-natraining wordt verwijderd. MOPD is ingezet in de natraining van MiMo-V2-Flash, een frontiermodel op industriële schaal, waarmee de praktische waarde voor capaciteitsintegratie in grensverleggende LLM's wordt aangetoond.
English
Modern large language models (LLMs) rely on reinforcement learning during post-training to push specific capabilities, yet integrating multiple capabilities into one model remains hard. Existing methods, such as Off-Policy Finetune and Mix-RL, are either inefficient or lose performance. In this work, we propose Multi-teacher On-Policy Distillation (MOPD), a post-training paradigm for combining the capabilities of multiple domain RL teachers: we first run per-domain specialised RL to obtain a set of domain teachers, then distill these teachers into the student on its own rollouts. This eliminates exposure bias and provides a dense optimization signal. On Qwen3-30B-A3B, MOPD outperforms Mix-RL, Cascade RL, Off-Policy Finetune, and Param-Merge baselines, inheriting nearly all of each teacher's capability. MOPD also enables parallel, independent development of domain teachers, removing the cross-domain coupling typical of multi-domain post-training. MOPD has been deployed in the post-training of MiMo-V2-Flash, an industrial-scale frontier model, demonstrating its practical value for capability integration in frontier-scale LLMs.