Melhorando LLMs com LLMs: Descoberta Agência para Escalonamento em Tempo de Teste
LLMs Improving LLMs: Agentic Discovery for Test-Time Scaling
May 8, 2026
Autores: Tong Zheng, Haolin Liu, Chengsong Huang, Huiwen Bao, Sheng Zhang, Rui Liu, Runpeng Dai, Ruibo Chen, Chenxi Liu, Tianyi Xiong, Xidong Wu, Hongming Zhang, Heng Huang
cs.AI
Resumo
**Escalonamento em Tempo de Teste (TTS)** tornou-se uma abordagem eficaz para melhorar o desempenho de modelos de linguagem de grande escala ao alocar computação adicional durante a inferência. No entanto, as estratégias de TTS existentes são em grande parte manuais: pesquisadores projetam padrões de raciocínio e ajustam heurísticas por intuição, deixando grande parte do espaço de alocação de computação inexplorado. Propomos um framework orientado por ambiente, **AutoTTS**, que altera o que os pesquisadores projetam: de heurísticas individuais de TTS para ambientes onde estratégias de TTS podem ser descobertas automaticamente. A chave do AutoTTS está na construção do ambiente: o ambiente de descoberta deve tornar o espaço de controle tratável e fornecer feedback barato e frequente para a busca de TTS. Como uma instanciação concreta, formulamos o TTS de largura--profundidade como síntese de controlador sobre trajetórias de raciocínio pré-coletadas e sinais de sondagem, onde os controladores decidem quando ramificar, continuar, sondar, podar ou parar e podem ser avaliados de forma barata sem chamadas repetidas de LLM. Introduzimos ainda a parametrização beta para tornar a busca tratável e feedback de traço de execução granular para melhorar a eficiência da descoberta, ajudando o agente a diagnosticar por que um programa TTS falha. Experimentos em benchmarks de raciocínio matemático mostram que as estratégias descobertas melhoram a relação custo-efetividade de precisão em comparação com linhas de base manuais robustas. As estratégias descobertas generalizam para benchmarks retidos e escalas de modelo, enquanto toda a descoberta custa apenas US$ 39,9 e 160 minutos. Nossos dados e código serão disponibilizados em https://github.com/zhengkid/AutoTTS.
English
Test-time scaling (TTS) has become an effective approach for improving large language model performance by allocating additional computation during inference. However, existing TTS strategies are largely hand-crafted: researchers manually design reasoning patterns and tune heuristics by intuition, leaving much of the computation-allocation space unexplored. We propose an environment-driven framework, AutoTTS, that changes what researchers design: from individual TTS heuristics to environments where TTS strategies can be discovered automatically. The key to AutoTTS lies in environment construction: the discovery environment must make the control space tractable and provide cheap, frequent feedback for TTS search. As a concrete instantiation, we formulate width--depth TTS as controller synthesis over pre-collected reasoning trajectories and probe signals, where controllers decide when to branch, continue, probe, prune, or stop and can be evaluated cheaply without repeated LLM calls. We further introduce beta parameterization to make the search tractable and fine-grained execution trace feedback to improve discovery efficiency by helping the agent diagnose why a TTS program fails. Experiments on mathematical reasoning benchmarks show that the discovered strategies improve the overall accuracy--cost tradeoff over strong manually designed baselines. The discovered strategies generalize to held-out benchmarks and model scales, while the entire discovery costs only $39.9 and 160 minutes. Our data, and code will be open-source at https://github.com/zhengkid/AutoTTS.