ChatPaper.aiChatPaper

FlowCompile : Un compilateur optimisant pour les workflows structurés basés sur les LLM

FlowCompile: An Optimizing Compiler for Structured LLM Workflows

May 13, 2026
Auteurs: Junyan Li, Zhang-Wei Hong, Maohao Shen, Yang Zhang, Chuang Gan
cs.AI

Résumé

Les workflows LLM structurés, dans lesquels des sous-agents LLM spécialisés exécutent selon un graphe prédéfini, sont devenus une abstraction puissante pour résoudre des tâches complexes. Optimiser de tels workflows, c'est-à-dire sélectionner des configurations pour chaque sous-agent afin d'équilibrer précision et latence, est difficile en raison de l'espace de conception combinatoire sur les choix de modèles, les budgets de raisonnement et les structures de workflow. Les méthodes existantes sensibles au coût traitent largement l'optimisation des workflows comme un problème de routage, sélectionnant une configuration au moment de l'inférence pour chaque requête selon l'objectif précision-latence utilisé lors de l'entraînement. Nous soutenons que les workflows LLM structurés peuvent également être optimisés d'un point de vue compilation : avant le déploiement, le système peut explorer globalement l'espace de conception du workflow et construire un ensemble réutilisable de configurations au niveau du workflow couvrant divers compromis précision-latence. En s'inspirant des compilateurs de machine learning, nous présentons FlowCompile, un compilateur de workflows LLM structurés qui effectue une exploration de l'espace de conception au moment de la compilation pour identifier un ensemble de compromis de haute qualité et réutilisable. FlowCompile décompose un workflow en sous-agents, profile chaque sous-agent sous diverses configurations, et compose ces mesures via un proxy structurel pour estimer la précision et la latence au niveau du workflow. Il identifie ensuite diverses configurations de haute qualité en un seul passage au moment de la compilation, sans réentraînement ni adaptation en ligne. Des expériences sur divers workflows et des benchmarks difficiles montrent que FlowCompile surpasse systématiquement les configurations de workflow optimisées heuristiquement et les références basées sur le routage, offrant jusqu'à 6,4 fois d'accélération. L'ensemble de configurations compilées sert en outre d'artefact d'optimisation réutilisable, permettant un déploiement flexible sous des préférences d'exécution variables et prenant en charge la sélection ou le routage en aval.
English
Structured LLM workflows, where specialized LLM sub-agents execute according to a predefined graph, have become a powerful abstraction for solving complex tasks. Optimizing such workflows, i.e., selecting configurations for each sub-agent to balance accuracy and latency, is challenging due to the combinatorial design space over model choices, reasoning budgets, and workflow structures. Existing cost-aware methods largely treat workflow optimization as a routing problem, selecting a configuration at inference time for each query according to the accuracy-latency objective used during training. We argue that structured LLM workflows can also be optimized from a compilation perspective: before deployment, the system can globally explore the workflow design space and construct a reusable set of workflow-level configurations spanning diverse accuracy-latency trade-offs. Drawing inspiration from machine learning compilers, we introduce FlowCompile, a structured LLM workflow compiler that performs compile-time design space exploration to identify a high-quality, reusable trade-off set. FlowCompile decomposes a workflow into sub-agents, profiles each sub-agent under diverse configurations, and composes these measurements through a structure-aware proxy to estimate workflow-level accuracy and latency. It then identifies diverse high-quality configurations in a single compile-time pass, without retraining or online adaptation. Experiments across diverse workflows and challenging benchmarks show that FlowCompile consistently outperforms heuristically optimized workflow configurations and routing-based baselines, delivering up to 6.4x speedup. The compiled configuration set further serves as a reusable optimization artifact, enabling flexible deployment under varying runtime preferences and supporting downstream selection or routing.