ChatPaper.aiChatPaper

GORGO: Ajuste en Línea para el Servicio de LLM Consciente de la Red entre Regiones

GORGO: Online Tuning for Cross-Region Network-Aware LLM Serving

June 30, 2026
Autores: Alessio Ricci Toniolo, Rome Thorstenson, Abinaya Dinesh
cs.AI

Resumen

Cada vez más, los servicios de inferencia de LLM utilizan proxies para enrutar las solicitudes de los clientes hacia réplicas del motor distribuidas globalmente. Las políticas de balanceo de carga deben considerar conjuntamente factores como la localidad de la caché KV, la carga de las réplicas y la latencia de red variable al optimizar métricas como la latencia y el TTFT. Sin embargo, los sistemas existentes solo evalúan un subconjunto de estos factores en su modelo de costos, lo que genera concentraciones desiguales de carga y caché KV entre las réplicas. Presentamos GORGO, una arquitectura de proxy que considera de manera integral la latencia de red, el costo de prellenado y la demora en cola mediante parámetros ajustables. Dado que los conjuntos de datos de chat de código abierto como LMSYS-Chat1M y WildChat-4.8M carecen de datos con contexto largo y alta reutilización de prefijo, publicamos un conjunto de datos sintético, ART-Chat-2.5M, generado a partir de metadatos de producción de contexto largo. Sobre una ventana de ajuste derivada de ART-Chat-2.5M, las estrategias evolutivas guían los parámetros de la política de GORGO para optimizar directamente el percentil 95 del TTFT. Durante las ventanas de evaluación fuera de muestra, fijamos los valores de los parámetros aprendidos durante el ajuste y mejoramos el percentil 95 del TTFT entre un 6.9-15.5% y la latencia extremo a extremo (E2E) del percentil 95 entre un 14.3-30.9% en comparación con políticas de balanceo de carga de referencia como la afinidad de sesión simple y la caché de prefijo. El código y el conjunto de datos ART-Chat-2.5M se encuentran en https://github.com/Arcadia-Research-Team/GORGO.
English
Increasingly, LLM inference services proxy client requests to engine replicas distributed globally. Load-balancing policies must jointly account for factors including KV-cache locality, replica load, and variable network latency when optimizing for metrics like latency and TTFT. However, existing systems only evaluate a subset of these factors in their cost model, leading to uneven concentrations of load and KV-cache across replicas. We present GORGO, a proxy architecture that holistically factors network latency, prefill cost, and queueing delay using tunable parameters. Since open-source chat datasets such as LMSYS-Chat1M and WildChat-4.8M lack long-context, high prefix-reuse data, we release a synthetic dataset, ART-Chat-2.5M, from long-context production metadata. On a tuning window from ART-Chat-2.5M, evolutionary strategies guide the GORGO policy's parameters to directly optimize p95 TTFT. During held-out evaluation windows, we fix the parameter values learned from tuning and improve p95 TTFT by 6.9-15.5% and p95 end-to-end (E2E) latency by 14.3-30.9% over baseline load-balancing policies such as simple session affinity and prefix-cache. The code and ART-Chat-2.5M dataset can be found at https://github.com/Arcadia-Research-Team/GORGO.