GORGO: Онлайн-настройка обслуживания LLM с учетом межрегиональной сети
GORGO: Online Tuning for Cross-Region Network-Aware LLM Serving
June 30, 2026
Авторы: Alessio Ricci Toniolo, Rome Thorstenson, Abinaya Dinesh
cs.AI
Аннотация
Всё чаще сервисы инференса LLM проксируют запросы клиентов к репликам движка, распределённым по всему миру. Политики балансировки нагрузки должны совместно учитывать такие факторы, как локальность KV-кэша, загрузка реплик и переменная задержка в сети, при оптимизации метрик, включая задержку и TTFT. Однако существующие системы учитывают лишь часть этих факторов в своей модели стоимости, что приводит к неравномерному распределению нагрузки и KV-кэша между репликами. Мы представляем GORGO — прокси-архитектуру, которая комплексно учитывает сетевую задержку, стоимость префилла и задержку в очереди с помощью настраиваемых параметров. Поскольку открытые наборы данных чатов, такие как LMSYS-Chat1M и WildChat-4.8M, не содержат данных с длинным контекстом и высокой повторной используемостью префиксов, мы выпускаем синтетический набор данных ART-Chat-2.5M, построенный на основе производственных метаданных с длинным контекстом. На окне настройки, основанном на ART-Chat-2.5M, эволюционные стратегии направляют параметры политики GORGO на непосредственную оптимизацию p95 TTFT. На отложенных окнах оценки мы фиксируем значения параметров, полученные в ходе настройки, и улучшаем p95 TTFT на 6.9–15.5%, а p95 сквозную (E2E) задержку — на 14.3–30.9% по сравнению с базовыми политиками балансировки нагрузки, такими как простая аффинность сеанса и кэш префиксов. Код и набор данных ART-Chat-2.5M доступны по адресу: https://github.com/Arcadia-Research-Team/GORGO.
English
Increasingly, LLM inference services proxy client requests to engine replicas distributed globally. Load-balancing policies must jointly account for factors including KV-cache locality, replica load, and variable network latency when optimizing for metrics like latency and TTFT. However, existing systems only evaluate a subset of these factors in their cost model, leading to uneven concentrations of load and KV-cache across replicas. We present GORGO, a proxy architecture that holistically factors network latency, prefill cost, and queueing delay using tunable parameters. Since open-source chat datasets such as LMSYS-Chat1M and WildChat-4.8M lack long-context, high prefix-reuse data, we release a synthetic dataset, ART-Chat-2.5M, from long-context production metadata. On a tuning window from ART-Chat-2.5M, evolutionary strategies guide the GORGO policy's parameters to directly optimize p95 TTFT. During held-out evaluation windows, we fix the parameter values learned from tuning and improve p95 TTFT by 6.9-15.5% and p95 end-to-end (E2E) latency by 14.3-30.9% over baseline load-balancing policies such as simple session affinity and prefix-cache. The code and ART-Chat-2.5M dataset can be found at https://github.com/Arcadia-Research-Team/GORGO.