GORGO : Réglage en ligne pour un service de LLM inter-région conscient du réseau
GORGO: Online Tuning for Cross-Region Network-Aware LLM Serving
June 30, 2026
Auteurs: Alessio Ricci Toniolo, Rome Thorstenson, Abinaya Dinesh
cs.AI
Résumé
De plus en plus, les services d'inférence des LLM relaient les requêtes clients vers des répliques de moteur distribuées à l'échelle mondiale. Les politiques d'équilibrage de charge doivent tenir compte conjointement de facteurs tels que la localité du cache KV, la charge des répliques et la latence réseau variable lors de l'optimisation de métriques comme la latence et le TTFT. Cependant, les systèmes existants n'évaluent qu'un sous-ensemble de ces facteurs dans leur modèle de coût, ce qui entraîne des concentrations inégales de charge et de cache KV entre les répliques. Nous présentons GORGO, une architecture proxy qui prend en compte de manière holistique la latence réseau, le coût de préremplissage et le délai d'attente à l'aide de paramètres ajustables. Étant donné que les ensembles de données de chat open source tels que LMSYS-Chat1M et WildChat-4.8M manquent de données à contexte long et à forte réutilisation de préfixe, nous publions un ensemble de données synthétique, ART-Chat-2.5M, à partir de métadonnées de production à contexte long. Sur une fenêtre de réglage issue d'ART-Chat-2.5M, des stratégies évolutionnaires guident les paramètres de la politique GORGO pour optimiser directement le p95 TTFT. Lors des fenêtres d'évaluation réservées, nous fixons les valeurs des paramètres apprises lors du réglage et améliorons le p95 TTFT de 6,9 à 15,5 % et la latence de bout en bout (E2E) p95 de 14,3 à 30,9 % par rapport aux politiques d'équilibrage de charge de base telles que l'affinité de session simple et le cache de préfixe. Le code et l'ensemble de données ART-Chat-2.5M sont disponibles à l'adresse https://github.com/Arcadia-Research-Team/GORGO.
English
Increasingly, LLM inference services proxy client requests to engine replicas distributed globally. Load-balancing policies must jointly account for factors including KV-cache locality, replica load, and variable network latency when optimizing for metrics like latency and TTFT. However, existing systems only evaluate a subset of these factors in their cost model, leading to uneven concentrations of load and KV-cache across replicas. We present GORGO, a proxy architecture that holistically factors network latency, prefill cost, and queueing delay using tunable parameters. Since open-source chat datasets such as LMSYS-Chat1M and WildChat-4.8M lack long-context, high prefix-reuse data, we release a synthetic dataset, ART-Chat-2.5M, from long-context production metadata. On a tuning window from ART-Chat-2.5M, evolutionary strategies guide the GORGO policy's parameters to directly optimize p95 TTFT. During held-out evaluation windows, we fix the parameter values learned from tuning and improve p95 TTFT by 6.9-15.5% and p95 end-to-end (E2E) latency by 14.3-30.9% over baseline load-balancing policies such as simple session affinity and prefix-cache. The code and ART-Chat-2.5M dataset can be found at https://github.com/Arcadia-Research-Team/GORGO.