Ajuste Fino Evolutivo: Aprendendo a Descobrir em 371 Tarefas de Otimização
Evolution Fine-Tuning: Learning to Discover Across 371 Optimization Tasks
June 27, 2026
Autores: Young-Jun Lee, Seungone Kim, Minki Kang, Alistair Cheong Liang Chuen, Zerui Chen, Seungho Han, Taehee Jung, Dongyeop Kang
cs.AI
Resumo
A experiência em projetar kernels de GPU mais rápidos poderia também ajudar a resolver uma conjectura matemática aberta de longa data? Modelos de Linguagem de Grande Escala (LLMs) integrados à busca evolucionária geraram, recentemente, soluções de última geração em tarefas de otimização, incluindo conjecturas matemáticas em aberto, projeto de kernels de GPU, descoberta de leis científicas e quebra-cabeças combinatórios. Para alcançar isso, trabalhos anteriores aplicaram arcabouços de busca a uma única tarefa alvo por vez, de modo que cada novo problema é abordado do zero e a experiência acumulada durante a busca é descartada assim que o modelo conclui sua tentativa. Isso faz com que a capacidade de evoluir iterativamente uma solução (por exemplo, saber qual parte mutar e como, decidir quando retroceder) resida inteiramente no arcabouço, e não no próprio modelo. A possibilidade de o modelo em si adquirir essa capacidade e reutilizá-la em diferentes tarefas permanece, em grande parte, inexplorada. Para abordar essa questão, introduzimos o Evolution Fine-Tuning (EFT), um paradigma de treinamento intermediário que ensina LLMs a evoluir soluções entre tarefas, convertendo trajetórias de busca evolucionária em supervisão. Construímos o Finch Collection, um conjunto de dados com 156 mil trajetórias abrangendo 10 domínios e 371 tarefas de otimização, e ajustamos finamente LLMs de código aberto com parâmetros de 2B a 9B. Empiricamente, o EFT confere generalização entre tarefas: em 22 tarefas retidas para teste, nossos modelos superam suas contrapartes base em média 10,22%. Além disso, quando combinado com aprendizado por reforço em tempo de teste, nosso modelo iguala o desempenho de última geração em duas tarefas de empacotamento de círculos e supera sua contraparte base no problema de mínima sobreposição de Erdős. Assim, o EFT serve como uma "fase de prática" para agentes de descoberta de propósito geral que não resolvem novos problemas do zero.
English
Would experience designing faster GPU kernels also help close in on a long-standing open mathematical conjecture? Large Language Models (LLMs) integrated into evolutionary search have recently produced state-of-the-art solutions on optimization tasks, including open mathematical conjectures, GPU kernel design, scientific law discovery, and combinatorial puzzles. To achieve this, prior work applied search scaffolds to one target task at a time, so every new problem is approached from scratch and the experience accumulated during search is discarded once the model finishes its attempt. This leaves the capability of iteratively evolving a solution (e.g., knowing which part to mutate and how, deciding when to backtrack) entirely in the scaffold rather than in the model itself. Whether the model itself could acquire this capability and reuse it across different tasks has been largely unexamined. To address this, we introduce Evolution Fine-Tuning (EFT), a mid-training paradigm that teaches LLMs to evolve solutions across tasks by converting evolutionary search trajectories into supervision. We construct Finch Collection, a 156K-trajectory dataset spanning 10 domains and 371 optimization tasks, and fine-tune open-source LLMs from 2B to 9B parameters. Empirically, EFT confers cross-task generalization: across 22 held-out tasks, our models surpass their base counterparts by 10.22% on average. Furthermore, when paired with test-time RL, our model matches state-of-the-art performance on two circle-packing tasks and outperforms its base-model counterpart on the Erdős minimum-overlap problem. EFT thus serves as a "practice phase" for general-purpose discovery agents that do not solve new problems from scratch.