Seu Modelo de Linguagem é o Seu Próprio Crítico: Aprendizado por Reforço com Estimativa de Valor a partir dos Estados Internos do Ator
Your Language Model is Its Own Critic: Reinforcement Learning with Value Estimation from Actor's Internal States
May 8, 2026
Autores: Yunho Choi, Jongwon Lim, Woojin Ahn, Minjae Oh, Jeonghoon Shim, Yohan Jo
cs.AI
Resumo
A aprendizagem por reforço com recompensas verificáveis (RLVR) para Modelos de Raciocínio de Grande Escala depende da estimativa de linha de base para redução de variância, mas as abordagens existentes pagam um preço alto: PPO requer um crítico na escala do modelo de política, enquanto GRPO precisa de múltiplos rollouts por prompt para manter sua média empírica de grupo estável. Apresentamos a Otimização de Política com Estimativa de Valor de Estados Internos (POISE), que obtém uma linha de base a um custo negligenciável, utilizando sinais internos do modelo de política já computados durante o passo direto da política. Uma sonda leve prevê a recompensa verificável esperada a partir dos estados ocultos do prompt e da trajetória gerada, bem como estatísticas de entropia de tokens, e é treinada online em conjunto com a política. Para preservar a imparcialidade do gradiente apesar do uso de características condicionadas pela trajetória, introduzimos uma construção de rollouts cruzados que prevê o valor de cada rollout a partir dos estados internos de um rollout independente. Como o POISE estima o valor do prompt utilizando apenas um único rollout, ele permite maior diversidade de prompts para um orçamento computacional fixo durante o treinamento. Isso reduz a variância do gradiente para uma aprendizagem mais estável e também elimina a sobrecarga computacional dos custos de amostragem para detectar prompts de vantagem zero. Nos benchmarks de raciocínio matemático do Qwen3-4B e DeepSeek-R1-Distill-Qwen-1.5B, o POISE iguala o DAPO enquanto requer menos computação. Além disso, seu estimador de valor apresenta desempenho semelhante ao de um modelo de valor separado na escala de LLM e generaliza para várias tarefas verificáveis. Ao aproveitar as próprias representações internas do modelo, o POISE permite uma otimização de política mais estável e eficiente.
English
Reinforcement learning with verifiable rewards (RLVR) for Large Reasoning Models hinges on baseline estimation for variance reduction, but existing approaches pay a heavy price: PPO requires a policy-model scale critic, while GRPO needs multiple rollouts per prompt to keep its empirical group mean stable. We introduce Policy Optimization with Internal State Value Estimation), which obtains a baseline at negligible cost by using the policy model's internal signals already computed during the policy forward pass. A lightweight probe predicts the expected verifiable reward from the hidden states of the prompt and generated trajectory, as well as token-entropy statistics, and is trained online alongside the policy. To preserve gradient unbiasedness despite using trajectory-conditioned features, we introduce a cross-rollout construction that predicts each rollout's value from an independent rollout's internal states. Because POISE estimates prompt value using only a single rollout, it enables higher prompt diversity for a fixed compute budget during training. This reduces gradient variance for more stable learning and also eliminates the compute overhead of sampling costs for detecting zero-advantage prompts. On Qwen3-4B and DeepSeek-R1-Distill-Qwen-1.5B across math reasoning benchmarks, POISE matches DAPO while requiring less compute. Moreover, its value estimator shows similar performance to a separate LLM-scale value model and generalizes to various verifiable tasks. By leveraging the model's own internal representations, POISE enables more stable and efficient policy optimization.