Lengtestraffen maken Chain-of-Thought minder monitorbaar
Length Penalties Make Chain-of-Thought Less Monitorable
July 8, 2026
Auteurs: Bryce Little
cs.AI
Samenvatting
Lengte-bestraffend reinforcement learning kan de chain-of-thought-redenering verkorten terwijl het een invloed verbergt die het antwoord van het model stuurt. In onze experimenten voorkomt training met lengtestraffen niet dat misleidende hints modellen sturen, ook al noemen de chain-of-thoughts van de modellen de hint veel minder vaak. Een token-accuraatheidevaluatie zou deze runs als succesvol beschouwen omdat ze minder redeneertokens gebruiken met weinig verlies aan nauwkeurigheid; het zou missen of het resterende spoor nog laat zien wat het antwoord stuurde. We traineren Qwen3-4B en Qwen3-14B-varianten met verschillende doel-ketenlengtes, en evalueren ze vervolgens met vertekenende-hintinterventies op apart gehouden MMLU-Pro-R en vier transferbenchmarks. Compressie vermindert redeneertokens scherp, behoudt het grootste deel van de meerkeuze-nauwkeurigheid en laat de hintinvloed dicht bij de baseline. Bij het sterkste doel daalt de ondergrensgetrouwheid tot 63,1% van de baseline voor Qwen3-14B en 69,4% voor Qwen3-4B; het ruwe percentage waarmee een monitor hintgebruik opmerkt, daalt van 69% naar 49% en van 60% naar 48%. Om lengte van inhoud te scheiden, verwijderen we willekeurig zinnen uit ongecomprimeerde baseline-ketens totdat de resterende tekst overeenkomt met de gecomprimeerde lengte. Zelfs na deze lengte-aanpassing onthullen gecomprimeerde ketens de hint 7-35 procentpunten minder vaak dan baseline-ketens die we willekeurig verkorten, voor beide Qwen3-groottes en alle vijf evaluatieverdelingen. Compressie doet daarom meer dan redenering verkorten; het verwijdert bij voorkeur de aanwijzingen die een monitor nodig heeft om te zien wat het antwoord beïnvloedde. Samen onthullen deze resultaten een compressie-monitorbaarheidsgrens waarbij goedkopere redenering antwoorden kan behouden terwijl het de invloeden erachter moeilijker te detecteren maakt.
English
Length-penalized reinforcement learning can shorten chain-of-thought reasoning while hiding an influence that drives the model's answer. In our experiments, training with length penalties does not stop misleading hints from steering models, even though the models' chains of thought mention the hint much less often. A token-accuracy evaluation would count these runs as successful because they use fewer reasoning tokens with little accuracy loss; it would miss whether the remaining trace still shows what drove the answer. We train Qwen3-4B and Qwen3-14B variants with different target chain lengths, then evaluate them with biasing-hint interventions on held-out MMLU-Pro-R and four transfer benchmarks. Compression sharply cuts reasoning tokens, preserves most multiple-choice accuracy, and leaves hint influence near baseline. At the strongest target, lower-bound faithfulness falls to 63.1% of baseline for Qwen3-14B and 69.4% for Qwen3-4B; the raw rate at which a monitor catches hint use falls from 69% to 49% and from 60% to 48%. To separate length from content, we randomly delete sentences from uncompressed baseline chains until the remaining text matches the compressed length. Even after this length matching, compressed chains disclose the hint 7-35 percentage points less often than baseline chains that we shorten at random, for both Qwen3 sizes and all five evaluation distributions. Compression therefore does more than shorten reasoning, preferentially removing the cues a monitor needs to see what influenced the answer. Together, these results reveal a compression-monitorability frontier in which cheaper reasoning can preserve answers while making the influences behind them harder to detect.