ChatPaper.aiChatPaper

O Primeiro Token Sabe: Confiança de Decodificação Única para Detecção de Alucinações

The First Token Knows: Single-Decode Confidence for Hallucination Detection

May 6, 2026
Autores: Mina Gabriel
cs.AI

Resumo

A autoconsistência detecta alucinações gerando múltiplas respostas amostradas para uma pergunta e medindo o acordo, mas isso requer decodificação repetida e pode ser sensível a variações lexicais. A autoconsistência semântica melhora isso agrupando respostas amostradas por significado usando inferência em linguagem natural, mas adiciona tanto custo de amostragem quanto sobrecarga de inferência externa. Mostramos que a confiança do primeiro token, phi_first, calculada a partir da entropia normalizada dos logits top-K no primeiro token de resposta com conteúdo de uma única decodificação greedy, iguala ou supera modestamente a autoconsistência semântica em tarefas de questionamento factual de resposta curta (closed-book). Em três modelos instrucionalmente ajustados de 7-8B e dois benchmarks, phi_first alcança uma média de AUROC de 0,820, comparado com 0,793 para o acordo semântico e 0,791 para a autoconsistência padrão de forma superficial. Um teste de subsunção mostra que phi_first está moderada a fortemente correlacionada com o acordo semântico, e combinar os dois sinais produz apenas uma pequena melhoria no AUROC em relação ao uso isolado do phi_first. Esses resultados sugerem que grande parte da informação de incerteza capturada pelo acordo de múltiplas amostras já está disponível na distribuição inicial de tokens do modelo. Argumentamos que phi_first deve ser relatado como uma linha de base padrão de baixo custo antes de invocar a estimativa de incerteza baseada em amostragem.
English
Self-consistency detects hallucinations by generating multiple sampled answers to a question and measuring agreement, but this requires repeated decoding and can be sensitive to lexical variation. Semantic self-consistency improves this by clustering sampled answers by meaning using natural language inference, but it adds both sampling cost and external inference overhead. We show that first-token confidence, phi_first, computed from the normalized entropy of the top-K logits at the first content-bearing answer token of a single greedy decode, matches or modestly exceeds semantic self-consistency on closed-book short-answer factual question answering. Across three 7-8B instruction-tuned models and two benchmarks, phi_first achieves a mean AUROC of 0.820, compared with 0.793 for semantic agreement and 0.791 for standard surface-form self-consistency. A subsumption test shows that phi_first is moderately to strongly correlated with semantic agreement, and combining the two signals yields only a small AUROC improvement over phi_first alone. These results suggest that much of the uncertainty information captured by multi-sample agreement is already available in the model's initial token distribution. We argue that phi_first should be reported as a default low-cost baseline before invoking sampling-based uncertainty estimation.