ChatPaper.aiChatPaper

Aprendizado por Reforço com Feedback Metacognitivo Evoca Expressão Fiel de Incerteza em LLMs

Reinforcement Learning with Metacognitive Feedback Elicits Faithful Uncertainty Expression in LLMs

June 30, 2026
Autores: Gabrielle Kaili-May Liu, Avi Caciularu, Gal Yona, Idan Szpektor, Arman Cohan
cs.AI

Resumo

A metacognição é um componente crítico da inteligência que descreve a capacidade de monitorar e regular os próprios processos cognitivos. No entanto, os LLMs apresentam deficiências sistêmicas em faculdades metacognitivas essenciais: alucinam com alta confiança, falham em reconhecer os limites do conhecimento e representam incorretamente sua própria incerteza interna — comprometendo a confiabilidade e a segurança. Uma vez que monitorar o desempenho em tarefas e adaptar o comportamento de acordo é central para a metacognição, postulamos que modelos capazes de julgar com precisão seu próprio desempenho estão em melhor posição para melhorá-lo. Operacionalizamos essa ideia por meio de dois mecanismos inovadores: aprendizado por reforço com feedback metacognitivo (ARFM), um paradigma para refinar ranqueamentos de completude durante a otimização de preferências com base na qualidade dos autojulgamentos de desempenho do modelo; e seleção de dados metacognitivos, que utiliza autojulgamentos semelhantes para identificar exemplos de treinamento de alto valor, superando a aprendizagem ativa ingênua. Aplicamos essas inovações ao problema da calibração fiel (CF), uma tarefa que é, em si, fundamentalmente metacognitiva: o objetivo é alinhar a incerteza expressa com a incerteza intrínseca, algo difícil mesmo para LLMs de ponta. Adotamos uma abordagem em dois estágios e desacoplada, primeiro usando esses métodos para calibrar a fidelidade das pontuações de confiança autorrelatadas pelos modelos, e depois mapeando para incerteza linguística natural e adaptável ao contexto por meio de edição direcionada da saída. Experimentos extensivos mostram que o ARFM alcança CF generalizável e de estado da arte em diversas tarefas, preservando a precisão. Além disso, o ARFM supera o RL padrão em até 63%, enquanto melhora a capacidade dos modelos de avaliar e expressar seus próprios limites de capacidade. Isso posiciona o ARFM como um paradigma promissor para aprimorar a metacognição dos LLMs em direção a melhores habilidades e alinhamento, e sugere que o desempenho metacognitivo é um sinal eficaz de RL para superar limitações de métodos anteriores de feedback intrínseco.
English
Metacognition is a critical component of intelligence that describes the ability to monitor and regulate one's own cognitive processes. Yet LLMs exhibit systemic deficiencies in key metacognitive faculties: they hallucinate with high confidence, fail to recognize knowledge boundaries, and misrepresent their internal uncertainty--undermining trustworthiness and reliability. Since monitoring task performance and adapting behavior accordingly are central to metacognition, we posit that models capable of accurately judging their own performance are better positioned to improve it. We operationalize this idea via two novel mechanisms: reinforcement learning with metacognitive feedback (RLMF), a paradigm to refine completion rankings during preference optimization based on the quality of a model's self-judgments of performance, and metacognitive data selection, which uses similar self-judgments to identify high-value training examples, outperforming naive active learning. We apply these innovations to the problem of faithful calibration (FC), a task that is itself fundamentally metacognitive: the goal is to align expressed with intrinsic uncertainty, difficult even for frontier LLMs. We adopt a two-stage, decoupled approach, first using these methods to calibrate the faithfulness of models' self-reported confidence scores, then mapping to natural, context-adaptable linguistic uncertainty via targeted output editing. Extensive experiments show RLMF achieves generalizable, state-of-the-art FC on diverse tasks while preserving accuracy. Further, RLMF surpasses standard RL by up to 63% while enhancing models' ability to assess and express their own capability limits. This positions RLMF as a promising paradigm to enhance LLM metacognition toward improved abilities and alignment, and suggests metacognitive performance as an effective RL signal to overcome limits of prior intrinsic feedback methods.