FlashEvolve : Accélération de l'auto-évolution de l'agent par orchestration asynchrone des étapes
FlashEvolve: Accelerating Agent Self-Evolution with Asynchronous Stage Orchestration
May 8, 2026
Auteurs: Zhengding Hu, Mingge Lu, Zhen Wang, Jixuan Ruan, Chang Chen, Zaifeng Pan, Yue Guan, Ruiyi Wang, Zhongkai Yu, Chao Zhang, Yufei Ding
cs.AI
Résumé
L'évolution basée sur les LLM est apparue comme une approche prometteuse pour améliorer les agents en affinant des artefacts non paramétriques, mais son coût en temps réel reste un goulot d'étranglement majeur. Nous identifions que ce coût provient de l'exécution synchronisée des étapes et du déséquilibre au sein de chaque étape lourde en LLM. Nous présentons FlashEvolve, un framework efficace qui remplace l'exécution synchronisée par des travailleurs asynchrones et des files d'attente, permettant le chevauchement des différentes étapes et phases. Pour gérer l'obsolescence des données introduite par l'asynchronisme, FlashEvolve suit les versions des artefacts et applique différentes politiques pour mettre à jour, ignorer ou corriger les artefacts obsolètes. Contrairement à l'obsolescence dans l'espace des poids en RL asynchrone, l'obsolescence dans l'espace linguistique est inspectable et réparable : un artefact obsolète n'est pas simplement un travail retardé, mais une preuve lisible que le LLM peut examiner, réviser et transformer en un signal d'évolution utile. FlashEvolve améliore également le débit et l'efficacité des tokens grâce à l'achèvement spéculatif des étapes et au contrôle adaptatif des flux. Sur les charges de travail GEPA, FlashEvolve améliore le débit des propositions de 3,5 fois sur vLLM local et de 4,9 fois sur le service API par rapport à GEPA synchrone. La même conception s'applique également à ACE et Meta-Harness.
English
LLM-based evolution has emerged as a promising way to improve agents by refining non-parametric artifacts, but its wall-clock cost remains a major bottleneck. We identify that this cost comes from synchronized stage execution and imbalance inside each LLM-heavy stage. We present FlashEvolve, an efficient framework that replaces synchronized execution with asynchronous workers and queues, allowing different stages and steps to overlap. To handle data staleness introduced by asynchrony, FlashEvolve tracks artifact versions and applies different policies to update, discard, or patch stale artifacts. Unlike weight-space staleness in asynchronous RL, language-space staleness is inspectable and repairable: a stale artifact is not just delayed work, but readable evidence that the LLM can reflect on, revise, and turn into useful evolution signal. FlashEvolve further improves throughput and token efficiency with speculative stage completion and adaptive workflow control. On GEPA workloads, FlashEvolve improves proposal throughput by 3.5times on local vLLM and 4.9times on API serving over synchronous GEPA. The same design also applies to ACE and Meta-Harness.