Betrouwbare Chain-of-Thought via Prefixconsistentie
Reliable Chain-of-Thought via Prefix Consistency
May 8, 2026
Auteurs: Naoto Iwase, Yuki Ichihara, Mohammad Atif Quamar, Junpei Komiyama
cs.AI
Samenvatting
Grote Taalmodellen verbeteren vaak de nauwkeurigheid bij redeneertaken door meerdere Chain-of-Thought (CoT)-traces te samplen en deze te aggregeren met meerderheidsstemming (MV), een testtijdtechniek die zelfconsistentie wordt genoemd. Wanneer we een CoT halverwege afkappen en de rest regenereren, zien we dat traces met correcte antwoorden hun oorspronkelijke antwoord vaker reproduceren dan traces met foute antwoorden. We gebruiken dit verschil als een betrouwbaarheidssignaal, prefixconsistentie, dat elk kandidaatantwoord weegt op basis van hoe vaak het opnieuw verschijnt onder regeneratie. Het vereist geen toegang tot token-logkansen of zelfbeoordelingsprompts. Over vijf redeneermodellen en vier wiskunde- en wetenschapsbenchmarks is prefixconsistentie in de meeste omgevingen de beste voorspeller van correctheid, en het herwegen van stemmen ermee bereikt de standaard MV-plateau-nauwkeurigheid bij tot 21x minder tokens (mediaan 4,6x). Onze code is beschikbaar op https://github.com/naoto-iwase/prefix-consistency.
English
Large Language Models often improve accuracy on reasoning tasks by sampling multiple Chain-of-Thought (CoT) traces and aggregating them with majority voting (MV), a test-time technique called self-consistency. When we truncate a CoT partway through and regenerate the remainder, we observe that traces with correct answers reproduce their original answer more often than traces with wrong answers. We use this difference as a reliability signal, prefix consistency, that weights each candidate answer by how often it reappears under regeneration. It requires no access to token log-probabilities or self-rating prompts. Across five reasoning models and four math and science benchmarks, prefix consistency is the best correctness predictor in most settings, and reweighting votes by it reaches Standard MV plateau accuracy at up to 21x fewer tokens (median 4.6x). Our code is available at https://github.com/naoto-iwase/prefix-consistency.