Evolutie-Fijnafstelling: Leren Ontdekken over 371 Optimalisatietaken
Evolution Fine-Tuning: Learning to Discover Across 371 Optimization Tasks
June 27, 2026
Auteurs: Young-Jun Lee, Seungone Kim, Minki Kang, Alistair Cheong Liang Chuen, Zerui Chen, Seungho Han, Taehee Jung, Dongyeop Kang
cs.AI
Samenvatting
Zou ervaring met het ontwerpen van snellere GPU-kernels ook kunnen helpen bij het naderen van een al lang bestaand open wiskundig vermoeden? Grote Taalmodellen (LLMs) geïntegreerd in evolutionair zoeken hebben recentelijk state-of-the-art oplossingen opgeleverd voor optimalisatietaken, waaronder open wiskundige vermoedens, GPU-kernelontwerp, ontdekking van natuurwetten en combinatorische puzzels. Om dit te bereiken, paste eerder werk zoeksteigers toe op één doeltaak tegelijk, zodat elk nieuw probleem vanuit het niets wordt benaderd en de tijdens het zoeken opgebouwde ervaring wordt weggegooid zodra het model zijn poging beëindigt. Dit laat het vermogen om iteratief een oplossing te ontwikkelen (bijv. weten welk deel te muteren en hoe, beslissen wanneer terug te keren) volledig in de steiger in plaats van in het model zelf. Of het model zelf dit vermogen zou kunnen verwerven en hergebruiken over verschillende taken, is grotendeels ononderzocht. Om dit aan te pakken, introduceren we Evolution Fine-Tuning (EFT), een mid-training paradigma dat LLMs leert om oplossingen over taken heen te ontwikkelen door evolutionaire zoektrajecten om te zetten in supervisie. We construeren Finch Collection, een dataset van 156K trajecten die 10 domeinen en 371 optimalisatietaken bestrijkt, en finetunen open-source LLMs van 2B tot 9B parameters. Empirisch gezien verleent EFT cross-task generalisatie: over 22 niet-geziene taken heen overtreffen onze modellen hun basismodellen gemiddeld met 10,22%. Bovendien, in combinatie met test-time RL, evenaart ons model de state-of-the-art prestaties op twee cirkelpakkingstaken en overtreft het zijn basismodel-tegenhanger op het Erdős minimale-overlap probleem. EFT dient dus als een 'oefenfase' voor algemene ontdekkingsagenten die nieuwe problemen niet vanuit het niets oplossen.
English
Would experience designing faster GPU kernels also help close in on a long-standing open mathematical conjecture? Large Language Models (LLMs) integrated into evolutionary search have recently produced state-of-the-art solutions on optimization tasks, including open mathematical conjectures, GPU kernel design, scientific law discovery, and combinatorial puzzles. To achieve this, prior work applied search scaffolds to one target task at a time, so every new problem is approached from scratch and the experience accumulated during search is discarded once the model finishes its attempt. This leaves the capability of iteratively evolving a solution (e.g., knowing which part to mutate and how, deciding when to backtrack) entirely in the scaffold rather than in the model itself. Whether the model itself could acquire this capability and reuse it across different tasks has been largely unexamined. To address this, we introduce Evolution Fine-Tuning (EFT), a mid-training paradigm that teaches LLMs to evolve solutions across tasks by converting evolutionary search trajectories into supervision. We construct Finch Collection, a 156K-trajectory dataset spanning 10 domains and 371 optimization tasks, and fine-tune open-source LLMs from 2B to 9B parameters. Empirically, EFT confers cross-task generalization: across 22 held-out tasks, our models surpass their base counterparts by 10.22% on average. Furthermore, when paired with test-time RL, our model matches state-of-the-art performance on two circle-packing tasks and outperforms its base-model counterpart on the Erdős minimum-overlap problem. EFT thus serves as a "practice phase" for general-purpose discovery agents that do not solve new problems from scratch.