Reinforcement Learning met metacognitieve feedback leidt tot getrouwe onzekerheidsuitdrukking in LLM's
Reinforcement Learning with Metacognitive Feedback Elicits Faithful Uncertainty Expression in LLMs
June 30, 2026
Auteurs: Gabrielle Kaili-May Liu, Avi Caciularu, Gal Yona, Idan Szpektor, Arman Cohan
cs.AI
Samenvatting
Metacognitie is een cruciaal onderdeel van intelligentie dat het vermogen beschrijft om de eigen cognitieve processen te monitoren en reguleren. Toch vertonen LLM's systematische tekortkomingen in belangrijke metacognitieve vermogens: ze hallucineren met hoog vertrouwen, slagen er niet in om kennisgrenzen te herkennen en geven een verkeerde voorstelling van hun interne onzekerheid—wat de betrouwbaarheid en geloofwaardigheid ondermijnt. Aangezien het monitoren van taakprestaties en het dienovereenkomstig aanpassen van gedrag centraal staan in metacognitie, stellen wij dat modellen die in staat zijn hun eigen prestaties nauwkeurig te beoordelen, beter gepositioneerd zijn om deze te verbeteren. We operationaliseren dit idee via twee nieuwe mechanismen: reinforcement learning met metacognitieve feedback (RLMF), een paradigma om voltooiingsrangschikkingen te verfijnen tijdens preferentieoptimalisatie op basis van de kwaliteit van de zelfbeoordelingen van een model van prestaties, en metacognitieve gegevensselectie, die vergelijkbare zelfbeoordelingen gebruikt om hoogwaardige trainingsvoorbeelden te identificeren, beter presterend dan naïeve actieve leerprocessen. We passen deze innovaties toe op het probleem van getrouwe calibratie (FC), een taak die zelf fundamenteel metacognitief is: het doel is om uitgedrukte onzekerheid af te stemmen op intrinsieke onzekerheid, wat zelfs voor geavanceerde LLM's moeilijk is. We hanteren een tweefasige, ontkoppelde aanpak: eerst gebruiken we deze methoden om de getrouwheid van de zelfgerapporteerde vertrouwensscores van modellen te calibreren, en vervolgens maken we via gerichte uitgavedbewerking de overstap naar natuurlijke, context-aanpasbare linguïstische onzekerheid. Uitgebreide experimenten tonen aan dat RLMF generaliseerbare, state-of-the-art FC bereikt op diverse taken, met behoud van nauwkeurigheid. Bovendien overtreft RLMF standaard RL met maar liefst 63%, terwijl het het vermogen van modellen om hun eigen capaciteitsgrenzen te beoordelen en uit te drukken verbetert. Dit positioneert RLMF als een veelbelovend paradigma om de metacognitie van LLM's te verbeteren richting verbeterde vaardigheden en afstemming, en suggereert metacognitieve prestaties als een effectief RL-signaal om de beperkingen van eerdere intrinsieke feedbackmethoden te overwinnen.
English
Metacognition is a critical component of intelligence that describes the ability to monitor and regulate one's own cognitive processes. Yet LLMs exhibit systemic deficiencies in key metacognitive faculties: they hallucinate with high confidence, fail to recognize knowledge boundaries, and misrepresent their internal uncertainty--undermining trustworthiness and reliability. Since monitoring task performance and adapting behavior accordingly are central to metacognition, we posit that models capable of accurately judging their own performance are better positioned to improve it. We operationalize this idea via two novel mechanisms: reinforcement learning with metacognitive feedback (RLMF), a paradigm to refine completion rankings during preference optimization based on the quality of a model's self-judgments of performance, and metacognitive data selection, which uses similar self-judgments to identify high-value training examples, outperforming naive active learning. We apply these innovations to the problem of faithful calibration (FC), a task that is itself fundamentally metacognitive: the goal is to align expressed with intrinsic uncertainty, difficult even for frontier LLMs. We adopt a two-stage, decoupled approach, first using these methods to calibrate the faithfulness of models' self-reported confidence scores, then mapping to natural, context-adaptable linguistic uncertainty via targeted output editing. Extensive experiments show RLMF achieves generalizable, state-of-the-art FC on diverse tasks while preserving accuracy. Further, RLMF surpasses standard RL by up to 63% while enhancing models' ability to assess and express their own capability limits. This positions RLMF as a promising paradigm to enhance LLM metacognition toward improved abilities and alignment, and suggests metacognitive performance as an effective RL signal to overcome limits of prior intrinsic feedback methods.