ChatPaper.aiChatPaper

Cadeia de Pensamento Confiável via Consistência de Prefixo

Reliable Chain-of-Thought via Prefix Consistency

May 8, 2026
Autores: Naoto Iwase, Yuki Ichihara, Mohammad Atif Quamar, Junpei Komiyama
cs.AI

Resumo

Modelos de Linguagem de Grande Porte frequentemente melhoram a precisão em tarefas de raciocínio amostrando múltiplas cadeias de pensamento (CoT) e agregando-as por votação majoritária (MV), uma técnica de tempo de teste chamada autoconsistência. Quando truncamos uma CoT no meio do processo e regeneramos o restante, observamos que as cadeias com respostas corretas reproduzem sua resposta original com mais frequência do que aquelas com respostas erradas. Utilizamos essa diferença como um sinal de confiabilidade, a consistência de prefixo, que pondera cada resposta candidata pela frequência com que ela reaparece sob regeneração. Isso não requer acesso a log-probabilidades dos tokens ou prompts de autoavaliação. Em cinco modelos de raciocínio e quatro benchmarks de matemática e ciências, a consistência de prefixo é o melhor preditor de correção na maioria dos cenários, e a reponderação dos votos por ela atinge a precisão de platô da votação majoritária padrão com até 21x menos tokens (mediana de 4,6x). Nosso código está disponível em https://github.com/naoto-iwase/prefix-consistency.
English
Large Language Models often improve accuracy on reasoning tasks by sampling multiple Chain-of-Thought (CoT) traces and aggregating them with majority voting (MV), a test-time technique called self-consistency. When we truncate a CoT partway through and regenerate the remainder, we observe that traces with correct answers reproduce their original answer more often than traces with wrong answers. We use this difference as a reliability signal, prefix consistency, that weights each candidate answer by how often it reappears under regeneration. It requires no access to token log-probabilities or self-rating prompts. Across five reasoning models and four math and science benchmarks, prefix consistency is the best correctness predictor in most settings, and reweighting votes by it reaches Standard MV plateau accuracy at up to 21x fewer tokens (median 4.6x). Our code is available at https://github.com/naoto-iwase/prefix-consistency.