FlashEvolve: Versnellen van Zelfevolutie van Agenten met Asynchrone Fase-Orkestratie
FlashEvolve: Accelerating Agent Self-Evolution with Asynchronous Stage Orchestration
May 8, 2026
Auteurs: Zhengding Hu, Mingge Lu, Zhen Wang, Jixuan Ruan, Chang Chen, Zaifeng Pan, Yue Guan, Ruiyi Wang, Zhongkai Yu, Chao Zhang, Yufei Ding
cs.AI
Samenvatting
LLM-gebaseerde evolutie is een veelbelovende manier gebleken om agenten te verbeteren door niet-parametrische artefacten te verfijnen, maar de werkelijke tijdkosten blijven een belangrijke bottleneck. Wij stellen vast dat deze kosten voortkomen uit gesynchroniseerde fase-uitvoering en onevenwicht binnen elke LLM-intensieve fase. We presenteren FlashEvolve, een efficiënt raamwerk dat gesynchroniseerde uitvoering vervangt door asynchrone werkers en wachtrijen, waardoor verschillende fasen en stappen kunnen overlappen. Om dataveroudering door asynchroniteit aan te pakken, houdt FlashEvolve artefactversies bij en past het verschillende beleidsregels toe om verouderde artefacten bij te werken, weg te gooien of te patchen. In tegenstelling tot gewichtsruimteveroudering bij asynchrone RL, is taalruimteveroudering inspecteerbaar en herstelbaar: een verouderd artefact is niet alleen uitgesteld werk, maar leesbaar bewijs waarop de LLM kan reflecteren, herzien en omzetten in een nuttig evolutiesignaal. FlashEvolve verbetert verder de doorvoer en tokenefficiëntie met speculatieve faseafronding en adaptieve werkstroomcontrole. Op GEPA-workloads verbetert FlashEvolve de voorstel-doorvoer met 3,5 keer op lokale vLLM en 4,9 keer op API-serving ten opzichte van synchrone GEPA. Hetzelfde ontwerp is ook van toepassing op ACE en Meta-Harness.
English
LLM-based evolution has emerged as a promising way to improve agents by refining non-parametric artifacts, but its wall-clock cost remains a major bottleneck. We identify that this cost comes from synchronized stage execution and imbalance inside each LLM-heavy stage. We present FlashEvolve, an efficient framework that replaces synchronized execution with asynchronous workers and queues, allowing different stages and steps to overlap. To handle data staleness introduced by asynchrony, FlashEvolve tracks artifact versions and applies different policies to update, discard, or patch stale artifacts. Unlike weight-space staleness in asynchronous RL, language-space staleness is inspectable and repairable: a stale artifact is not just delayed work, but readable evidence that the LLM can reflect on, revise, and turn into useful evolution signal. FlashEvolve further improves throughput and token efficiency with speculative stage completion and adaptive workflow control. On GEPA workloads, FlashEvolve improves proposal throughput by 3.5times on local vLLM and 4.9times on API serving over synchronous GEPA. The same design also applies to ACE and Meta-Harness.