いつ止めるべきかを知る:過剰思考を削減するためのセグメントレベルでのクレジット割り当て
Know When to Stop: Segment-Level Credit Assignment for Reducing Overthinking
August 4, 2026
著者: Chia-Hsuan Lee, Sihui Dai, Mingyang Zhou, Isha Slavin, Hsuan Su, Shi-Xiong Zhang, Sambit Sahu, William Campbell
cs.AI
要旨
推論言語モデルはしばしば過剰思考に陥る。すなわち、ヘッジ、アプローチの放棄、自己矛盾などの行動の長い連鎖を生成し、トークンを消費するだけで回答を改善しない。我々は、これらの行動が単に応答長の結果ではないことを示す。応答長を制御しても、誤ったトレースは正しいトレースよりも非生産的な自己内省の割合が高い。この問題に対処するには、自己内省が有効な箇所と有害な箇所を特定する必要があるが、ステップレベルのアノテーションを得るにはコストがかかる。我々は、推論トレース内の中間回答コミットメントが安価な代理指標を提供することを見出す。すなわち、トレース内の各最終回答候補を正解と比較することで、追加の教師信号なしに後続の内省が生産的かどうかを判定できる。この知見に基づき、我々はDASH(Drift Aware advantage SHaping)を提案する。DASHは、各推論セグメントが正解へ近づくか遠ざかるかに基づいて、セグメントレベルのクレジットを割り当てる。競技レベルの数学ベンチマークにおいて、DASHは過剰思考が蔓延する状況下で最高の精度を達成する(平均精度:59.45%、Dr.GRPO:58.1%、GRPO:56.95%)。同時に、過剰思考行動を低減し、ベースラインよりも生産的な自己修正を実現する。
English
Reasoning language models frequently overthink: generating extended chains of behaviors such as hedging, approach abandonment, and self contradiction that consume tokens without improving answers. We show that these behaviors are not merely a consequence of length; even when controlling for response length, incorrect traces exhibit higher rates of unproductive self-reflection than correct ones. Addressing this requires identifying where self-reflection helps vs hurts, but obtaining these step-level annotations is costly. We observe that intermediate answer commitments within reasoning traces can provide a cheap proxy: by comparing each final answer candidate in the trace to the ground truth, we can determine whether subsequent reflection is productive without any additional supervision. Building on this insight, we propose DASH (Drift Aware advantage SHaping), which assigns segment-level credit based on whether each reasoning segment leads toward or away from correctness. On competition-level math benchmarks, DASH achieves the highest accuracy where overthinking is prevalent (Average Accuracy: 59.45% vs. 58.1% Dr.GRPO vs. 56.95% GRPO) while reducing overthinking behaviors and achieving more productive self-correction than baselines.