ChatPaper.aiChatPaper

Além do SFT para RL: Pré-alinhamento via Destilação On-Policy de Caixa-Preta para RL Multimodal

Beyond SFT-to-RL: Pre-alignment via Black-Box On-Policy Distillation for Multimodal RL

May 1, 2026
Autores: Sudong Wang, Weiquan Huang, Xiaomin Yu, Zuhao Yang, Hehai Lin, Keming Wu, Chaojun Xiao, Chen Chen, Wenxuan Wang, Beier Zhu, Yunjian Zhang, Chengwei Qin
cs.AI

Resumo

A receita padrão de pós-treinamento para grandes modelos multimodais (LMMs) aplica o ajuste fino supervisionado (SFT) em demonstrações curadas, seguido por aprendizado por reforço com recompensas verificáveis (RLVR). No entanto, o SFT introduz um desvio distribucional que nem preserva as capacidades originais do modelo nem corresponde fielmente à distribuição de supervisão. Este problema é ainda mais amplificado no raciocínio multimodal, onde erros de perceção e falhas de raciocínio seguem padrões de desvio distintos que se agravam durante o RL subsequente. Apresentamos o PRISM, um pipeline de três fases que mitiga este desvio ao inserir uma fase explícita de alinhamento distribucional entre o SFT e o RLVR. Baseando-se no princípio da destilação on-policy (OPD), o PRISM formula o alinhamento como um jogo adversarial de caixa-preta a nível de resposta entre a política e um discriminador Mixture-of-Experts (MoE) com especialistas dedicados à perceção e ao raciocínio, fornecendo sinais corretivos desacoplados que orientam a política para a distribuição de supervisão sem exigir acesso aos logits do professor. Embora 1,26 milhões de demonstrações públicas sejam suficientes para uma inicialização ampla do SFT, o alinhamento distribucional exige supervisão de maior fidelidade; por isso, curamos 113 mil demonstrações adicionais a partir do Gemini 3 Flash, com anotação visual densa e raciocínio passo a passo sobre os problemas mais difíceis não resolvidos. Experiências no Qwen3-VL mostram que o PRISM melhora consistentemente o desempenho do RLVR subsequente em vários algoritmos de RL (GRPO, DAPO, GSPO) e benchmarks multimodais diversos, aumentando a precisão média em +4,4 e +6,0 pontos em relação à linha de base SFT-to-RLVR nas versões de 4B e 8B, respetivamente. O nosso código, dados e checkpoints do modelo estão publicamente disponíveis em https://github.com/XIAO4579/PRISM.
English
The standard post-training recipe for large multimodal models (LMMs) applies supervised fine-tuning (SFT) on curated demonstrations followed by reinforcement learning with verifiable rewards (RLVR). However, SFT introduces distributional drift that neither preserves the model's original capabilities nor faithfully matches the supervision distribution. This problem is further amplified in multimodal reasoning, where perception errors and reasoning failures follow distinct drift patterns that compound during subsequent RL. We introduce PRISM, a three-stage pipeline that mitigates this drift by inserting an explicit distribution-alignment stage between SFT and RLVR. Building on the principle of on-policy distillation (OPD), PRISM casts alignment as a black-box, response-level adversarial game between the policy and a Mixture-of-Experts (MoE) discriminator with dedicated perception and reasoning experts, providing disentangled corrective signals that steer the policy toward the supervision distribution without requiring access to teacher logits. While 1.26M public demonstrations suffice for broad SFT initialization, distribution alignment demands higher-fidelity supervision; we therefore curate 113K additional demonstrations from Gemini 3 Flash, featuring dense visual grounding and step-by-step reasoning on the hardest unsolved problems. Experiments on Qwen3-VL show that PRISM consistently improves downstream RLVR performance across multiple RL algorithms (GRPO, DAPO, GSPO) and diverse multimodal benchmarks, improving average accuracy by +4.4 and +6.0 points over the SFT-to-RLVR baseline on 4B and 8B, respectively. Our code, data, and model checkpoints are publicly available at https://github.com/XIAO4579/PRISM.