ChatPaper.aiChatPaper

Agrupar, Roteirizar, Escalar: Framework em Cascata para Serviço de LLM Consciente de Custos

Cluster, Route, Escalate: Cascaded Framework for Cost-Aware LLM Serving

June 25, 2026
Autores: Yasmin Moslem, Magdalena Kacmajor, Vasudevan Nedumpozhimana, Ammar Abbas, Solmaz Panahi, David Lynch, Zhuangzhuang Nie, Alexandros Agapitos, Aleksandar Milenovic, Hongmeng Song, Yucheng Shi, Yue Pan, Patricia Buffini, John D. Kelleher
cs.AI

Resumo

A implantação eficiente de modelos de linguagem grandes (LLMs) em produção impõe uma troca entre precisão e custo. Os operadores frequentemente recorrem a um único modelo, que é caro para consultas fáceis ou insuficiente para as difíceis. Para enfrentar esse desafio, propomos uma solução em cascata de dois estágios. O Estágio 1 agrupa as consultas recebidas e atribui cada grupo ao seu modelo mais custo-efetivo. O orçamento de custo para esse processo de roteamento é definido por um hiperparâmetro interpretável, ajustado offline. O Estágio 2 adiciona uma cascata de estimativa de qualidade (QE); quando uma saída do Estágio 1 é considerada de baixa qualidade, a consulta é escalada para um modelo mais forte. Isso garante que apenas casos difíceis ou de baixa confiança cheguem aos modelos caros. Nos conjuntos de dados de teste, o sistema em cascata mantém 97-99% da precisão do modelo mais forte, enquanto reduz o Tempo por Token de Saída (TPOT). Ele requer apenas rótulos de correção de tarefa e se adapta a mudanças no conjunto de modelos sem reconfiguração manual.
English
Efficient deployment of large language models (LLMs) in production forces a trade-off between accuracy and cost. Operators often default to a single model that is either expensive for easy queries or insufficient for hard ones. To address this challenge, we propose a two-stage cascaded solution. Stage 1 clusters incoming queries and assigns each cluster to its most cost-effective model. The cost budget for this routing process is set by an interpretable hyperparameter, tuned offline. Stage 2 adds a quality estimation (QE) cascade; when an output from Stage 1 is judged low-quality, the query is escalated to a stronger model. This ensures only hard or low-confidence cases reach the expensive models. On the test datasets, the cascaded system retains 97-99% of the strongest model's accuracy while reducing Time Per Output Token (TPOT). It requires only task-correctness labels and adapts to changes in the model pool without manual reconfiguration.