ChatPaper.aiChatPaper

A Miragem da Otimização de Políticas de Treinamento: Políticas de Inferência Monotônicas como o Objetivo Real para o Aprendizado por Reforço de LLMs

The Mirage of Optimizing Training Policies: Monotonic Inference Policies as the Real Objective for LLM Reinforcement Learning

June 28, 2026
Autores: Jing Liang, Hongyao Tang, Yi Ma, Yancheng He, Weixun Wang, Xiaoyang Li, Ju Huang, Wenbo Su, Jinyi Liu, Yan Zheng, Jianye Hao, Bo Zheng
cs.AI

Resumo

O aprendizado por reforço (RL) tem recebido atenção crescente no pós-treinamento de modelos de linguagem de grande escala (LLMs), porém o treinamento RL permanece frágil e pode sofrer de instabilidade ou colapso. Uma causa vital é a incompatibilidade entre treinamento e inferência: LLMs adotam mecanismos separados de inferência e treinamento para eficiência de geração e precisão de treinamento, o que na prática exibe probabilidades inconsistentes para as mesmas trajetórias nos lados de treinamento e inferência, mesmo com parâmetros do modelo sincronizados. Isso naturalmente induz um tipo especial de caráter off-policy que sempre existe e envenena o treinamento. Trabalhos anteriores fizeram vários esforços para lidar com esse caráter off-policy a fim de estabilizar as políticas de treinamento sob a incompatibilidade. Neste artigo, apontamos o desalinhamento de objetivo negligenciado por trabalhos existentes: uma atualização efetiva da política no mecanismo de treinamento não garante necessariamente a melhoria da política de inferência, ou seja, aquela usada na implantação. Para isso, propomos um novo objetivo de otimização de política para RL de LLMs, denominado Melhoria Monotônica da Política de Inferência (MIPI). Seguindo esse princípio, apresentamos a Atualização Monotônica da Política de Inferência (MIPU), uma estrutura de RL de LLM em duas etapas que constrói atualizações candidatas referenciadas pelo amostrador e aceita seletivamente candidatos sincronizados usando um proxy de lacuna do lado da inferência. Experimentos realizados em duas escalas de modelo sob alta incompatibilidade mostram que o MIPU melhora o desempenho médio de raciocínio e a estabilidade do treinamento.
English
Reinforcement learning (RL) has gained growing attention in large language model (LLM) post-training, yet RL training remains fragile and can suffer from instability or collapse. One vital cause is training-inference mismatch: LLM adopts separate inference and training engines for generation efficiency and training precision, which in practice exhibits inconsistent probabilities for the same trajectories on training and inference sides, even with synchronized model parameters. This naturally induces a special type of off-policyness ever existing and poisoning the training. Prior works have made various efforts in addressing the off-policyness to stabilize the training policies under the mismatch. In this paper, we point out the objective misalignment neglected by existing works that an effective update to the policy in the training engine not necessarily ensures the improvement of the inference policy, i.e., the one used in deployment. To this end, we propose a new policy optimization objective for LLM RL, named Monotonic Inference Policy Improvement (MIPI). Following this principle, we introduce Monotonic Inference Policy Update (MIPU), a two-step LLM RL framework that constructs sampler-referenced candidate updates and selectively accepts synchronized candidates using an inference-side gap proxy. Experiments conducted on two model scales under high mismatch show that MIPU improves average reasoning performance and training stability.