ChatPaper.aiChatPaper

MOPD: Destilação On-Policy com Múltiplos Professores para Integração de Capacidades no Pós-Treinamento de LLMs

MOPD: Multi-Teacher On-Policy Distillation for Capability Integration in LLM Post-Training

June 29, 2026
Autores: Wenhan Ma, Jianyu Wei, Liang Zhao, Hailin Zhang, Bangjun Xiao, Lei Li, Qibin Yang, Bofei Gao, Yudong Wang, Rang Li, Jinhao Dong, Zhifang Sui, Fuli Luo
cs.AI

Resumo

Modelos modernos de linguagem de grande escala (LLMs) dependem de aprendizado por reforço durante o pós-treinamento para impulsionar capacidades específicas, mas integrar múltiplas capacidades em um único modelo ainda é difícil. Métodos existentes, como Ajuste Fino Fora da Política (Off-Policy Finetune) e Mistura-RL (Mix-RL), são ineficientes ou perdem desempenho. Neste trabalho, propomos a Destilação On-Policy com Múltiplos Professores (Multi-teacher On-Policy Distillation, MOPD), um paradigma de pós-treinamento para combinar as capacidades de múltiplos professores de RL especializados em domínios: primeiro, executamos RL especializado por domínio para obter um conjunto de professores de domínio e, em seguida, destilamos esses professores no estudante usando suas próprias trajetórias geradas (rollouts). Isso elimina o viés de exposição e fornece um sinal de otimização denso. No Qwen3-30B-A3B, o MOPD supera as linhas de base de Mistura-RL, RL em Cascata (Cascade RL), Ajuste Fino Fora da Política e Fusão de Parâmetros (Param-Merge), herdando quase toda a capacidade de cada professor. O MOPD também permite o desenvolvimento paralelo e independente de professores de domínio, eliminando o acoplamento entre domínios típico do pós-treinamento multi-domínio. O MOPD foi implantado no pós-treinamento do MiMo-V2-Flash, um modelo de fronteira em escala industrial, demonstrando seu valor prático para a integração de capacidades em LLMs de fronteira.
English
Modern large language models (LLMs) rely on reinforcement learning during post-training to push specific capabilities, yet integrating multiple capabilities into one model remains hard. Existing methods, such as Off-Policy Finetune and Mix-RL, are either inefficient or lose performance. In this work, we propose Multi-teacher On-Policy Distillation (MOPD), a post-training paradigm for combining the capabilities of multiple domain RL teachers: we first run per-domain specialised RL to obtain a set of domain teachers, then distill these teachers into the student on its own rollouts. This eliminates exposure bias and provides a dense optimization signal. On Qwen3-30B-A3B, MOPD outperforms Mix-RL, Cascade RL, Off-Policy Finetune, and Param-Merge baselines, inheriting nearly all of each teacher's capability. MOPD also enables parallel, independent development of domain teachers, removing the cross-domain coupling typical of multi-domain post-training. MOPD has been deployed in the post-training of MiMo-V2-Flash, an industrial-scale frontier model, demonstrating its practical value for capability integration in frontier-scale LLMs.