Uma busca verificável não é uma cadeia de pensamento aprendível.
A Verifiable Search Is Not a Learnable Chain-of-Thought
June 20, 2026
Autores: Harsh Patel
cs.AI
Resumo
É tentador supor que qualquer tarefa solucionável por um programa curto possa ser ensinada a um modelo como sua cadeia de pensamento: escrever os passos, ajustar finamente, e o modelo segue. Este artigo mostra que essa suposição falha para uma classe identificável de procedimentos. O ambiente de teste são nove tarefas de raciocínio, cada uma proveniente de um gerador determinístico; divisões públicas e ocultas compartilham geradores, de modo que os dados retidos servem como proxy para a precisão do teste. Eu engenharia reversa dos geradores em solucionadores Python, os converto em cadeia de pensamento e destilo em um LoRA de posto ≤ 32 sobre um modelo Nemotron de 30B (3,5B ativos). Tarefas computáveis para frente se instalam prontamente: consulta/aritmética e uma tarefa booleana de 8 bits transferem (≥ 0,99 e 0,68). A criptoaritmética não: destilar sua busca com retrocesso se mantém em 0,01-0,07 em onze projetos de cadeia de pensamento, aprendizado por reforço a partir de recompensas verificáveis e autotreinamento, mesmo que um solucionador de busca responda a 71% das instâncias. Isso não é uma lacuna de capacidade. O modelo realiza a aritmética em 97-100% das linhas e classifica a cifra correta entre as oito principais em 71%; ele não consegue conduzir a busca adiante como uma derivação da esquerda para a direita. O ajuste fino aprende a forma de uma etapa de eliminação verificável enquanto seus vereditos se tornam modelos incondicionais, corretos apenas 16-57% das vezes ("veredito-como-token"). O teto se mantém entre arquiteturas de 3B a 671B e entre ajuste fino e prompting; uma intervenção controlada isola a causa: revelar a chave da cifra, que torna a derivação direta, eleva as mesmas instâncias de 0,03 para 0,57. Quando a única solução de um procedimento é a busca sobre uma estrutura isenta de informação, não existe nenhuma cadeia de pensamento direta fiel para imitar. A tarefa se torna aprendível apenas removendo a busca, pré-calculando seu núcleo combinatório em um catálogo e reduzindo o traço a recordação mais verificação; a solução em primeiro lugar atinge 0,92 no Private LB dessa forma. O que se destila é memorização e verificação, não busca.
English
It is tempting to assume any task solvable by a short program can be taught to a model as its chain-of-thought: write the steps out, fine-tune, and the model follows. This paper shows the assumption fails for an identifiable class of procedures. The testbed is nine reasoning tasks, each from a deterministic generator; public and hidden splits share generators, so held-out data proxies test accuracy. I reverse-engineer the generators into Python solvers, render them as chain-of-thought, and distill into a rank-<= 32 LoRA over a 30B (3.5B-active) Nemotron model. Forward-computable tasks install readily: lookup/arithmetic and an 8-bit boolean task transfer (>= 0.99 and 0.68). Cryptarithm does not: distilling its backtracking search holds at 0.01-0.07 across eleven chain-of-thought designs, RL from verifiable rewards, and self-training, even though a search solver answers 71% of instances. This is not a capability gap. The model does the arithmetic on 97-100% of lines and ranks the correct cipher in its top eight on 71%; it cannot carry the search forward as a left-to-right derivation. Fine-tuning learns the shape of a verifiable elimination step while its verdicts become unconditional templates, correct only 16-57% of the time ("verdict-as-token"). The ceiling holds across backbones from 3B to 671B and across fine-tuning and prompting; a controlled intervention isolates the cause: revealing the cipher key, which turns the derivation forward, lifts the same instances from 0.03 to 0.57. When a procedure's only solution is search over information-free structure, no faithful forward chain-of-thought exists to imitate. The task becomes learnable only by removing the search, precomputing its combinatorial core into a catalog and reducing the trace to recall plus verification; the 1st-place solution reaches Private LB 0.92 this way. What distills is memorization and verification, not search.