Ensinando Modelos de Linguagem a Pensar em Código
Teaching Language Models to Think in Code
May 11, 2026
Autores: Hyeon Hwang, Jiwoo Lee, Jaewoo Kang
cs.AI
Resumo
O raciocínio integrado a ferramentas (TIR) emergiu como um paradigma dominante para a resolução de problemas matemáticos em modelos de linguagem, combinando raciocínio em linguagem natural (LN) com execução de código. No entanto, essa configuração intercalada apresenta três limitações principais: o código frequentemente atua como um verificador post-hoc, os cálculos intermediários em LN são propensos a erros, e a LN e o código desempenham papéis sobrepostos, em vez de claramente distintos. Propomos o ThinC (Pensando em Código), uma estrutura na qual o próprio código serve como raciocinador, em vez de uma ferramenta invocada pela LN. Uma trajetória do ThinC começa com uma breve etapa de planejamento em LN, após a qual todo o raciocínio se desenrola por meio de blocos de código conectados apenas por suas saídas de execução. Destilamos 12,2 mil trajetórias centradas em código a partir de um modelo professor e treinamos o ThinC-1.7B e o ThinC-4B com ajuste fino supervisionado seguido de aprendizado por reforço. O ThinC-4B supera consistentemente todas as linhas de base do TIR em cinco benchmarks matemáticos de nível competitivo e até ultrapassa o modelo muito maior Qwen3-235B-A22B-Thinking. Análises adicionais mostram que o ThinC raciocina por meio de código: 99,2% de suas respostas finais são fundamentadas na saída do interpretador, e o modelo se recupera de forma confiável de falhas de execução de código sem raciocínio intermediário em LN. Nosso código e modelos serão disponibilizados em breve.
English
Tool-integrated reasoning (TIR) has emerged as a dominant paradigm for mathematical problem solving in language models, combining natural language (NL) reasoning with code execution. However, this interleaved setup has three key limitations: code often acts as a post-hoc verifier, intermediate NL computations are error-prone, and NL and code play overlapping rather than clearly distinct roles. We propose ThinC (Thinking in Code), a framework in which code itself serves as the reasoner rather than as a tool invoked by NL. A ThinC trajectory begins with a brief NL planning step, after which all reasoning unfolds through code blocks connected only by their execution outputs. We distill 12.2k code-centric trajectories from a teacher model and train ThinC-1.7B and ThinC-4B with supervised fine-tuning followed by reinforcement learning. ThinC-4B consistently outperforms every TIR baseline on five competition-level math benchmarks and even surpasses the much larger Qwen3-235B-A22B-Thinking. Further analysis shows that ThinC reasons through code: 99.2% of its final answers are grounded in interpreter output, and the model recovers reliably from code execution failures without intermediate NL reasoning. Our code and models will be released soon.