ChatPaper.aiChatPaper

FlashEvolve: Acelerando a Auto-evolução de Agentes com Orquestração Assíncrona de Estágios

FlashEvolve: Accelerating Agent Self-Evolution with Asynchronous Stage Orchestration

May 8, 2026
Autores: Zhengding Hu, Mingge Lu, Zhen Wang, Jixuan Ruan, Chang Chen, Zaifeng Pan, Yue Guan, Ruiyi Wang, Zhongkai Yu, Chao Zhang, Yufei Ding
cs.AI

Resumo

A evolução baseada em LLMs surgiu como uma abordagem promissora para aprimorar agentes por meio do refinamento de artefatos não paramétricos, mas seu custo em tempo real continua sendo um grande gargalo. Identificamos que esse custo advém da execução sincronizada de estágios e do desequilíbrio dentro de cada estágio pesado em LLM. Apresentamos o FlashEvolve, uma estrutura eficiente que substitui a execução sincronizada por trabalhadores assíncronos e filas, permitindo a sobreposição de diferentes estágios e etapas. Para lidar com a desatualização dos dados introduzida pela assincronia, o FlashEvolve rastreia versões de artefatos e aplica diferentes políticas para atualizar, descartar ou corrigir artefatos desatualizados. Diferentemente da desatualização no espaço de pesos em RL assíncrona, a desatualização no espaço de linguagem é inspecionável e reparável: um artefato desatualizado não é apenas trabalho atrasado, mas evidência legível que o LLM pode refletir, revisar e transformar em sinal evolutivo útil. O FlashEvolve melhora ainda mais a taxa de transferência e a eficiência de tokens com conclusão especulativa de estágios e controle adaptativo de fluxo de trabalho. Em cargas de trabalho GEPA, o FlashEvolve melhora a taxa de transferência de propostas em 3,5 vezes no vLLM local e em 4,9 vezes na API de serviço em relação ao GEPA síncrono. O mesmo design também se aplica ao ACE e ao Meta-Harness.
English
LLM-based evolution has emerged as a promising way to improve agents by refining non-parametric artifacts, but its wall-clock cost remains a major bottleneck. We identify that this cost comes from synchronized stage execution and imbalance inside each LLM-heavy stage. We present FlashEvolve, an efficient framework that replaces synchronized execution with asynchronous workers and queues, allowing different stages and steps to overlap. To handle data staleness introduced by asynchrony, FlashEvolve tracks artifact versions and applies different policies to update, discard, or patch stale artifacts. Unlike weight-space staleness in asynchronous RL, language-space staleness is inspectable and repairable: a stale artifact is not just delayed work, but readable evidence that the LLM can reflect on, revise, and turn into useful evolution signal. FlashEvolve further improves throughput and token efficiency with speculative stage completion and adaptive workflow control. On GEPA workloads, FlashEvolve improves proposal throughput by 3.5times on local vLLM and 4.9times on API serving over synchronous GEPA. The same design also applies to ACE and Meta-Harness.