ChatPaper.aiChatPaper

Pesquisa Automatizada com Agentes Especializados Desenvolve Receitas de Treinamento Eficazes e Não Triviais

Auto Research with Specialist Agents Develops Effective and Non-Trivial Training Recipes

May 7, 2026
Autores: Jingjie Ning, Xiaochuan Li, Ji Zeng, Hao Kang, Chenyan Xiong
cs.AI

Resumo

Estudamos a pesquisa automatizada como um ciclo empírico fechado orientado por medição externa. Cada submissão de teste carrega uma hipótese, uma edição de código executável, um resultado pertencente ao avaliador e um *feedback* que molda a próxima proposta. O resultado não é um artigo gerado ou um único *checkpoint* de modelo, mas uma trajetória auditável de propostas, *diffs* de código, experimentos, pontuações e rótulos de falha. Instanciamos este ciclo com agentes especialistas que particionam superfícies de receita e compartilham linhagem mensurada entre os testes. A principal descoberta empírica é que o *feedback* de linhagem permite que os agentes transformem os resultados do avaliador — incluindo travamentos, estouros de orçamento, falhas de tamanho e erros nos limites de precisão — em edições posteriores de receita a nível de programa, em vez de sugestões únicas. Ao longo de 1.197 testes principais e 600 testes de controlo do Parameter Golf após configuração e lançamento únicos, os humanos não escolheram propostas, editaram receitas, anularam pontuações ou repararam testes com falha durante a busca. Nos três testes principais, o mesmo ciclo de submissão reduz o bpb de validação do Parameter Golf em 0,81%, aumenta o NanoChat-D12 CORE em 38,7% e reduz o tempo de execução (*wallclock*) do CIFAR-10 Airbench96 em 4,59%, com cada tarefa medida pelo seu próprio avaliador externo e verificações de legalidade. O rastreio inclui uma auditoria estrita de domínio arquitetural de 157 submissões principais e reescritas de programa, como uma alteração no caminho do *kernel* de atenção do NanoChat. Dentro deste escopo, o ciclo escreve código autonomamente, submete experimentos, absorve *feedback*, aplica e combina técnicas conhecidas dentro de cada ambiente e aprimora receitas públicas iniciais.
English
We study auto research as a closed empirical loop driven by external measurement. Each submitted trial carries a hypothesis, an executable code edit, an evaluator-owned outcome, and feedback that shapes the next proposal. The output is not a generated paper or a single model checkpoint, but an auditable trajectory of proposals, code diffs, experiments, scores, and failure labels. We instantiate this loop with specialist agents that partition recipe surfaces and share measured lineage across trials. The central empirical finding is that lineage feedback lets agents turn evaluator outcomes, including crashes, budget overruns, size failures, and accuracy-gate misses, into later program-level recipe edits rather than one-shot suggestions. Across 1,197 headline-run trials plus 600 Parameter Golf control trials after one-time setup and launch, humans did not choose proposals, edit recipes, override scores, or repair failed trials during the search. In the three headline runs, the same submitted-trial loop reduces Parameter Golf validation bpb by 0.81%, raises NanoChat-D12 CORE by 38.7%, and reduces CIFAR-10 Airbench96 wallclock by 4.59%, with each task measured by its own external evaluator and legality checks. The trace includes a strict architecture-domain audit of 157 headline-run submissions and program rewrites such as a NanoChat attention-kernel path change. Within this scope the loop autonomously writes code, submits experiments, absorbs feedback, applies and combines known techniques inside each environment, and improves public starting recipes.