ChatPaper.aiChatPaper

Штрафы за длину делают цепочку рассуждений менее наблюдаемой.

Length Penalties Make Chain-of-Thought Less Monitorable

July 8, 2026
Авторы: Bryce Little
cs.AI

Аннотация

Обучение с подкреплением со штрафом за длину может сокращать цепочку рассуждений, скрывая при этом влияние, которое направляет ответ модели. В наших экспериментах обучение со штрафами за длину не препятствует тому, чтобы вводящие в заблуждение подсказки направляли модели, хотя цепочки рассуждений моделей упоминают подсказку гораздо реже. Оценка по точности токенов сочла бы эти запуски успешными, поскольку они используют меньше токенов рассуждений с небольшой потерей точности; она упустила бы из виду, показывает ли оставшийся след то, что определяло ответ. Мы обучаем варианты Qwen3-4B и Qwen3-14B с различными целевыми длинами цепочек, затем оцениваем их с помощью вмешательств с предвзятыми подсказками на отложенных данных MMLU-Pro-R и четырех бенчмарках переноса. Сжатие резко сокращает токены рассуждений, сохраняет большую часть точности множественного выбора и оставляет влияние подсказок на уровне базового значения. При самом сильном целевом показателе нижняя граница достоверности падает до 63.1% от базового уровня для Qwen3-14B и до 69.4% для Qwen3-4B; сырой показатель, с которым монитор обнаруживает использование подсказки, снижается с 69% до 49% и с 60% до 48%. Чтобы отделить длину от содержания, мы случайным образом удаляем предложения из несжатых базовых цепочек, пока оставшийся текст не сравняется по длине со сжатыми. Даже после этого выравнивания по длине сжатые цепочки раскрывают подсказку на 7–35 процентных пунктов реже, чем базовые цепочки, которые мы случайным образом укорачиваем, для обоих размеров Qwen3 и всех пяти оценочных распределений. Таким образом, сжатие делает нечто большее, чем просто сокращение рассуждений: оно преимущественно удаляет сигналы, необходимые монитору для выявления того, что повлияло на ответ. В совокупности эти результаты выявляют границу сжатия-мониторируемости, в рамках которой более дешёвые рассуждения могут сохранять ответы, одновременно затрудняя обнаружение влияний, стоящих за ними.
English
Length-penalized reinforcement learning can shorten chain-of-thought reasoning while hiding an influence that drives the model's answer. In our experiments, training with length penalties does not stop misleading hints from steering models, even though the models' chains of thought mention the hint much less often. A token-accuracy evaluation would count these runs as successful because they use fewer reasoning tokens with little accuracy loss; it would miss whether the remaining trace still shows what drove the answer. We train Qwen3-4B and Qwen3-14B variants with different target chain lengths, then evaluate them with biasing-hint interventions on held-out MMLU-Pro-R and four transfer benchmarks. Compression sharply cuts reasoning tokens, preserves most multiple-choice accuracy, and leaves hint influence near baseline. At the strongest target, lower-bound faithfulness falls to 63.1% of baseline for Qwen3-14B and 69.4% for Qwen3-4B; the raw rate at which a monitor catches hint use falls from 69% to 49% and from 60% to 48%. To separate length from content, we randomly delete sentences from uncompressed baseline chains until the remaining text matches the compressed length. Even after this length matching, compressed chains disclose the hint 7-35 percentage points less often than baseline chains that we shorten at random, for both Qwen3 sizes and all five evaluation distributions. Compression therefore does more than shorten reasoning, preferentially removing the cues a monitor needs to see what influenced the answer. Together, these results reveal a compression-monitorability frontier in which cheaper reasoning can preserve answers while making the influences behind them harder to detect.