ChatPaper.aiChatPaper

Uw taalmodel is zijn eigen criticus: Versterkingsleren met waardeberekening op basis van interne toestanden van de actor

Your Language Model is Its Own Critic: Reinforcement Learning with Value Estimation from Actor's Internal States

May 8, 2026
Auteurs: Yunho Choi, Jongwon Lim, Woojin Ahn, Minjae Oh, Jeonghoon Shim, Yohan Jo
cs.AI

Samenvatting

Versterkend leren met verifieerbare beloningen (RLVR) voor grote redeneermodellen is afhankelijk van basisschatting voor variantiereductie, maar bestaande benaderingen betalen een hoge prijs: PPO vereist een criticus op beleidsmodelschaal, terwijl GRPO meerdere uitrolsessies per prompt nodig heeft om het empirische groepsgemiddelde stabiel te houden. Wij introduceren Policy Optimization with Internal State Value Estimation (POISE), dat een baseline verkrijgt tegen verwaarloosbare kosten door gebruik te maken van de interne signalen van het beleidsmodel die al zijn berekend tijdens de voorwaartse doorgang van het beleid. Een lichtgewicht probe voorspelt de verwachte verifieerbare beloning op basis van de verborgen toestanden van de prompt en het gegenereerde traject, evenals token-entropiestatistieken, en wordt online getraind samen met het beleid. Om gradient-onvertekendheid te behouden ondanks het gebruik van trajectgeconditioneerde kenmerken, introduceren we een kruis-uitrolconstructie die de waarde van elke uitrolsessie voorspelt op basis van de interne toestanden van een onafhankelijke uitrolsessie. Omdat POISE de promptwaarde schat met slechts één uitrolsessie, maakt het een hogere promptdiversiteit mogelijk voor een vast rekenbudget tijdens de training. Dit vermindert de gradientvariantie voor stabieler leren en elimineert ook de rekenoverhead van bemonsteringskosten voor het detecteren van nul-voordeel-prompts. Op Qwen3-4B en DeepSeek-R1-Distill-Qwen-1.5B, op wiskunderedeneerbenchmarks, evenaart POISE DAPO terwijl het minder rekenkracht vereist. Bovendien vertoont de waarde-schatter vergelijkbare prestaties als een afzonderlijk LLM-schaalwaardemodel en generaliseert het naar diverse verifieerbare taken. Door gebruik te maken van de eigen interne representaties van het model, maakt POISE stabielere en efficiëntere beleidsoptimalisatie mogelijk.
English
Reinforcement learning with verifiable rewards (RLVR) for Large Reasoning Models hinges on baseline estimation for variance reduction, but existing approaches pay a heavy price: PPO requires a policy-model scale critic, while GRPO needs multiple rollouts per prompt to keep its empirical group mean stable. We introduce Policy Optimization with Internal State Value Estimation), which obtains a baseline at negligible cost by using the policy model's internal signals already computed during the policy forward pass. A lightweight probe predicts the expected verifiable reward from the hidden states of the prompt and generated trajectory, as well as token-entropy statistics, and is trained online alongside the policy. To preserve gradient unbiasedness despite using trajectory-conditioned features, we introduce a cross-rollout construction that predicts each rollout's value from an independent rollout's internal states. Because POISE estimates prompt value using only a single rollout, it enables higher prompt diversity for a fixed compute budget during training. This reduces gradient variance for more stable learning and also eliminates the compute overhead of sampling costs for detecting zero-advantage prompts. On Qwen3-4B and DeepSeek-R1-Distill-Qwen-1.5B across math reasoning benchmarks, POISE matches DAPO while requiring less compute. Moreover, its value estimator shows similar performance to a separate LLM-scale value model and generalizes to various verifiable tasks. By leveraging the model's own internal representations, POISE enables more stable and efficient policy optimization.