Otimização de Política Listwise: RLVR Baseado em Grupo como Projeção de Alvo no Simplex de Respostas do LLM
Listwise Policy Optimization: Group-based RLVR as Target-Projection on the LLM Response Simplex
May 7, 2026
Autores: Yun Qu, Qi Wang, Yixiu Mao, Heming Zou, Yuhang Jiang, Yingyue Li, Wutong Xu, Lizhou Cai, Weijie Liu, Clive Bai, Kai Yang, Yangkun Chen, Saiyong Yang, Xiangyang Ji
cs.AI
Resumo
A aprendizagem por reforço com recompensas verificáveis (RLVR) tornou-se uma abordagem padrão para o pós-treinamento de modelos de linguagem de grande porte (LLMs) com o objetivo de incentivar a capacidade de raciocínio. Entre as receitas existentes, o gradiente de política baseado em grupos é predominante, que amostra um grupo de respostas por prompt e atualiza a política por meio de sinais de vantagem relativos ao grupo. Este trabalho revela que essas estratégias de otimização compartilham uma estrutura geométrica comum: cada uma define implicitamente uma distribuição alvo no simplex de respostas e projeta em direção a ela por meio de uma aproximação de primeira ordem. Com base nessa percepção, propomos a Otimização de Política Listwise (LPO) para conduzir explicitamente a projeção do alvo, que desmistifica o alvo implícito ao restringir o objetivo RL proximal ao simplex de respostas e, em seguida, projeta a política por meio da minimização exata da divergência. Este framework proporciona (i) melhoria monotônica no objetivo listwise com gradientes de projeção limitados, de soma zero e autocorretivos, e (ii) flexibilidade na seleção da divergência com propriedades estruturais distintas por meio da etapa de projeção desacoplada. Em diversas tarefas de raciocínio e backbones de LLMs, a LPO melhora consistentemente o desempenho do treinamento em relação às linhas de base típicas de gradiente de política sob alvos correspondentes, preservando intrinsecamente a estabilidade da otimização e a diversidade das respostas.
English
Reinforcement learning with verifiable rewards (RLVR) has become a standard approach for large language models (LLMs) post-training to incentivize reasoning capacity. Among existing recipes, group-based policy gradient is prevalent, which samples a group of responses per prompt and updates the policy via group-relative advantage signals. This work reveals that these optimization strategies share a common geometric structure: each implicitly defines a target distribution on the response simplex and projects toward it via first-order approximation. Building on this insight, we propose Listwise Policy Optimization (LPO) to explicitly conduct the target-projection, which demystifies the implicit target by restricting the proximal RL objective to the response simplex, and then projects the policy via exact divergence minimization. This framework provides (i) monotonic improvement on the listwise objective with bounded, zero-sum, and self-correcting projection gradients, and (ii) flexibility in divergence selection with distinct structural properties through the decoupled projection step. On diverse reasoning tasks and LLM backbones, LPO consistently improves training performance over typical policy gradient baselines under matched targets, while intrinsically preserving optimization stability and response diversity.