ChatPaper.aiChatPaper

Taalmodellen leren denken in code

Teaching Language Models to Think in Code

May 11, 2026
Auteurs: Hyeon Hwang, Jiwoo Lee, Jaewoo Kang
cs.AI

Samenvatting

Gereedschapsgeïntegreerd redeneren (Tool-integrated reasoning, TIR) is uitgegroeid tot een dominant paradigma voor het oplossen van wiskundige problemen in taalmodellen, waarbij redeneren in natuurlijke taal (NT) wordt gecombineerd met code-uitvoering. Deze verweven opzet kent echter drie belangrijke beperkingen: code fungeert vaak als een post-hoc verificateur, tussentijdse NT-berekeningen zijn foutgevoelig en NT en code vervullen overlappende in plaats van duidelijk gescheiden rollen. Wij stellen ThinC (Thinking in Code) voor, een raamwerk waarin code zelf fungeert als redeneerder in plaats van als een door NT aangeroepen gereedschap. Een ThinC-traject begint met een korte NT-planningsstap, waarna al het redeneren zich ontvouwt via codeblokken die alleen verbonden zijn door hun uitvoeringsoutputs. We distilleren 12,2k codegerichte trajecten uit een leraarmodel en trainen ThinC-1.7B en ThinC-4B met begeleide fijnafstemming gevolgd door reinforcement learning. ThinC-4B presteert consequent beter dan elke TIR-baseline op vijf wiskundebenchmarks op wedstrijdniveau en overtreft zelfs de veel grotere Qwen3-235B-A22B-Thinking. Verdere analyse toont aan dat ThinC redeneert door middel van code: 99,2% van de uiteindelijke antwoorden is gebaseerd op uitvoer van de interpreter, en het model herstelt betrouwbaar van code-uitvoeringsfouten zonder tussentijds NT-redeneren. Onze code en modellen zullen binnenkort worden vrijgegeven.
English
Tool-integrated reasoning (TIR) has emerged as a dominant paradigm for mathematical problem solving in language models, combining natural language (NL) reasoning with code execution. However, this interleaved setup has three key limitations: code often acts as a post-hoc verifier, intermediate NL computations are error-prone, and NL and code play overlapping rather than clearly distinct roles. We propose ThinC (Thinking in Code), a framework in which code itself serves as the reasoner rather than as a tool invoked by NL. A ThinC trajectory begins with a brief NL planning step, after which all reasoning unfolds through code blocks connected only by their execution outputs. We distill 12.2k code-centric trajectories from a teacher model and train ThinC-1.7B and ThinC-4B with supervised fine-tuning followed by reinforcement learning. ThinC-4B consistently outperforms every TIR baseline on five competition-level math benchmarks and even surpasses the much larger Qwen3-235B-A22B-Thinking. Further analysis shows that ThinC reasons through code: 99.2% of its final answers are grounded in interpreter output, and the model recovers reliably from code execution failures without intermediate NL reasoning. Our code and models will be released soon.