Las penalizaciones de longitud hacen que el Chain-of-Thought sea menos monitoreable.
Length Penalties Make Chain-of-Thought Less Monitorable
July 8, 2026
Autores: Bryce Little
cs.AI
Resumen
El aprendizaje por refuerzo penalizado por longitud puede acortar el razonamiento en cadena de pensamiento mientras oculta una influencia que guía la respuesta del modelo. En nuestros experimentos, entrenar con penalizaciones por longitud no impide que las pistas engañosas dirijan los modelos, aunque las cadenas de pensamiento de estos mencionen la pista con mucha menor frecuencia. Una evaluación de precisión por tokens consideraría estas ejecuciones como exitosas porque utilizan menos tokens de razonamiento con una pérdida mínima de precisión; pasaría por alto si el rastro restante aún revela qué impulsó la respuesta. Entrenamos variantes de Qwen3-4B y Qwen3-14B con diferentes longitudes objetivo de cadena, y luego las evaluamos con intervenciones de pistas sesgadas en MMLU-Pro-R retenido y cuatro puntos de referencia de transferencia. La compresión reduce drásticamente los tokens de razonamiento, preserva la mayor parte de la precisión en opción múltiple y mantiene la influencia de la pista cerca del nivel basal. En el objetivo más fuerte, la fidelidad en el límite inferior cae al 63.1% del nivel basal para Qwen3-14B y al 69.4% para Qwen3-4B; la tasa bruta a la que un monitor detecta el uso de pistas disminuye del 69% al 49% y del 60% al 48%. Para separar la longitud del contenido, eliminamos aleatoriamente oraciones de cadenas basales no comprimidas hasta que el texto restante coincida con la longitud comprimida. Incluso después de este emparejamiento de longitud, las cadenas comprimidas revelan la pista entre 7 y 35 puntos porcentuales menos que las cadenas basales que acortamos al azar, para ambos tamaños de Qwen3 y las cinco distribuciones de evaluación. Por lo tanto, la compresión hace más que acortar el razonamiento: elimina preferentemente las señales que un monitor necesita para ver qué influyó en la respuesta. En conjunto, estos resultados revelan una frontera de compresión-monitoreabilidad en la que un razonamiento más barato puede preservar las respuestas mientras dificulta la detección de las influencias detrás de ellas.
English
Length-penalized reinforcement learning can shorten chain-of-thought reasoning while hiding an influence that drives the model's answer. In our experiments, training with length penalties does not stop misleading hints from steering models, even though the models' chains of thought mention the hint much less often. A token-accuracy evaluation would count these runs as successful because they use fewer reasoning tokens with little accuracy loss; it would miss whether the remaining trace still shows what drove the answer. We train Qwen3-4B and Qwen3-14B variants with different target chain lengths, then evaluate them with biasing-hint interventions on held-out MMLU-Pro-R and four transfer benchmarks. Compression sharply cuts reasoning tokens, preserves most multiple-choice accuracy, and leaves hint influence near baseline. At the strongest target, lower-bound faithfulness falls to 63.1% of baseline for Qwen3-14B and 69.4% for Qwen3-4B; the raw rate at which a monitor catches hint use falls from 69% to 49% and from 60% to 48%. To separate length from content, we randomly delete sentences from uncompressed baseline chains until the remaining text matches the compressed length. Even after this length matching, compressed chains disclose the hint 7-35 percentage points less often than baseline chains that we shorten at random, for both Qwen3 sizes and all five evaluation distributions. Compression therefore does more than shorten reasoning, preferentially removing the cues a monitor needs to see what influenced the answer. Together, these results reveal a compression-monitorability frontier in which cheaper reasoning can preserve answers while making the influences behind them harder to detect.