GORGO: Online tuning voor cross-regio netwerkbewuste LLM-serving
GORGO: Online Tuning for Cross-Region Network-Aware LLM Serving
June 30, 2026
Auteurs: Alessio Ricci Toniolo, Rome Thorstenson, Abinaya Dinesh
cs.AI
Samenvatting
In toenemende mate sturen LLM-inferentiediensten clientverzoeken door naar wereldwijd verspreide engine-replica's via een proxy. Load-balancingbeleid moet gezamenlijk rekening houden met factoren zoals KV-cache-lokaliteit, replica-belasting en variabele netwerklatentie bij het optimaliseren van metrieken zoals latentie en TTFT. Bestaande systemen evalueren echter slechts een deel van deze factoren in hun kostenmodel, wat leidt tot ongelijke concentraties van belasting en KV-cache over replica's. Wij presenteren GORGO, een proxy-architectuur die holistisch rekening houdt met netwerklatentie, prefill-kosten en wachtrijvertraging door middel van afstelbare parameters. Omdat open-source chatdatasets zoals LMSYS-Chat1M en WildChat-4.8M weinig gegevens met lange context en hoge prefix-hergebruik bevatten, publiceren wij een synthetische dataset, ART-Chat-2.5M, afkomstig van productiemetadata met lange context. Op een afstemvenster van ART-Chat-2.5M sturen evolutionaire strategieën de parameters van het GORGO-beleid aan om direct de p95 TTFT te optimaliseren. Tijdens evaluatievensters met vasthouding fixeren we de uit afstemming geleerde parameterwaarden en verbeteren we de p95 TTFT met 6,9–15,5% en de p95 end-to-end (E2E)-latentie met 14,3–30,9% ten opzichte van basislijn-load-balancingbeleid zoals eenvoudige sessieaffiniteit en prefix-cache. De code en de ART-Chat-2.5M-dataset zijn te vinden op https://github.com/Arcadia-Research-Team/GORGO.
English
Increasingly, LLM inference services proxy client requests to engine replicas distributed globally. Load-balancing policies must jointly account for factors including KV-cache locality, replica load, and variable network latency when optimizing for metrics like latency and TTFT. However, existing systems only evaluate a subset of these factors in their cost model, leading to uneven concentrations of load and KV-cache across replicas. We present GORGO, a proxy architecture that holistically factors network latency, prefill cost, and queueing delay using tunable parameters. Since open-source chat datasets such as LMSYS-Chat1M and WildChat-4.8M lack long-context, high prefix-reuse data, we release a synthetic dataset, ART-Chat-2.5M, from long-context production metadata. On a tuning window from ART-Chat-2.5M, evolutionary strategies guide the GORGO policy's parameters to directly optimize p95 TTFT. During held-out evaluation windows, we fix the parameter values learned from tuning and improve p95 TTFT by 6.9-15.5% and p95 end-to-end (E2E) latency by 14.3-30.9% over baseline load-balancing policies such as simple session affinity and prefix-cache. The code and ART-Chat-2.5M dataset can be found at https://github.com/Arcadia-Research-Team/GORGO.