ChatPaper.aiChatPaper

GORGO: Ajuste Online para Serviço de LLM Ciente da Rede entre Regiões

GORGO: Online Tuning for Cross-Region Network-Aware LLM Serving

June 30, 2026
Autores: Alessio Ricci Toniolo, Rome Thorstenson, Abinaya Dinesh
cs.AI

Resumo

Cada vez mais, serviços de inferência de LLM fazem proxy de solicitações de clientes para réplicas de motor distribuídas globalmente. Políticas de balanceamento de carga devem considerar conjuntamente fatores como localidade do cache KV, carga da réplica e latência de rede variável ao otimizar métricas como latência e TTFT. No entanto, sistemas existentes avaliam apenas um subconjunto desses fatores em seu modelo de custo, levando a concentrações desiguais de carga e cache KV entre as réplicas. Apresentamos GORGO, uma arquitetura de proxy que considera holisticamente latência de rede, custo de preenchimento e atraso de fila usando parâmetros ajustáveis. Como conjuntos de dados de chat de código aberto, como LMSYS-Chat1M e WildChat-4.8M, carecem de dados de contexto longo e alto reuso de prefixo, disponibilizamos um conjunto de dados sintético, ART-Chat-2.5M, a partir de metadados de produção de contexto longo. Em uma janela de ajuste extraída do ART-Chat-2.5M, estratégias evolutivas guiam os parâmetros da política GORGO para otimizar diretamente o p95 TTFT. Durante janelas de avaliação retidas, fixamos os valores dos parâmetros aprendidos no ajuste e melhoramos o p95 TTFT em 6,9–15,5% e a latência ponta a ponta (E2E) p95 em 14,3–30,9% em relação a políticas de balanceamento de carga de base, como afinidade de sessão simples e cache de prefixo. O código e o conjunto de dados ART-Chat-2.5M podem ser encontrados em https://github.com/Arcadia-Research-Team/GORGO.
English
Increasingly, LLM inference services proxy client requests to engine replicas distributed globally. Load-balancing policies must jointly account for factors including KV-cache locality, replica load, and variable network latency when optimizing for metrics like latency and TTFT. However, existing systems only evaluate a subset of these factors in their cost model, leading to uneven concentrations of load and KV-cache across replicas. We present GORGO, a proxy architecture that holistically factors network latency, prefill cost, and queueing delay using tunable parameters. Since open-source chat datasets such as LMSYS-Chat1M and WildChat-4.8M lack long-context, high prefix-reuse data, we release a synthetic dataset, ART-Chat-2.5M, from long-context production metadata. On a tuning window from ART-Chat-2.5M, evolutionary strategies guide the GORGO policy's parameters to directly optimize p95 TTFT. During held-out evaluation windows, we fix the parameter values learned from tuning and improve p95 TTFT by 6.9-15.5% and p95 end-to-end (E2E) latency by 14.3-30.9% over baseline load-balancing policies such as simple session affinity and prefix-cache. The code and ART-Chat-2.5M dataset can be found at https://github.com/Arcadia-Research-Team/GORGO.