Clusteren, Routeren, Escaleren: Trapsgewijs raamwerk voor kostenbewust LLM-serveren
Cluster, Route, Escalate: Cascaded Framework for Cost-Aware LLM Serving
June 25, 2026
Auteurs: Yasmin Moslem, Magdalena Kacmajor, Vasudevan Nedumpozhimana, Ammar Abbas, Solmaz Panahi, David Lynch, Zhuangzhuang Nie, Alexandros Agapitos, Aleksandar Milenovic, Hongmeng Song, Yucheng Shi, Yue Pan, Patricia Buffini, John D. Kelleher
cs.AI
Samenvatting
Efficiënte implementatie van grote taalmodellen (Large Language Models, LLM's) in productieomgevingen leidt tot een afweging tussen nauwkeurigheid en kosten. Exploitanten kiezen vaak standaard voor één enkel model dat óf te duur is voor eenvoudige vragen, óf ontoereikend voor moeilijke. Om deze uitdaging aan te pakken, stellen we een cascade-oplossing in twee fasen voor. Fase 1 clustert binnenkomende vragen en wijst elk cluster toe aan het meest kosteneffectieve model. Het kostenbudget voor dit routeringsproces wordt bepaald door een interpreteerbare hyperparameter die offline wordt afgesteld. Fase 2 voegt een kwaliteitsschatting (quality estimation, QE) cascade toe; wanneer een uitvoer uit Fase 1 als van lage kwaliteit wordt beoordeeld, wordt de vraag doorgestuurd naar een sterker model. Dit zorgt ervoor dat alleen moeilijke of onzekere gevallen bij de dure modellen terechtkomen. Op de testdatasets behoudt het cascadesysteem 97-99% van de nauwkeurigheid van het sterkste model, terwijl de tijd per uitvoertoken (Time Per Output Token, TPOT) wordt verlaagd. Het vereist alleen taakcorrectheidslabels en past zich aan veranderingen in de modelpool aan zonder handmatige herconfiguratie.
English
Efficient deployment of large language models (LLMs) in production forces a trade-off between accuracy and cost. Operators often default to a single model that is either expensive for easy queries or insufficient for hard ones. To address this challenge, we propose a two-stage cascaded solution. Stage 1 clusters incoming queries and assigns each cluster to its most cost-effective model. The cost budget for this routing process is set by an interpretable hyperparameter, tuned offline. Stage 2 adds a quality estimation (QE) cascade; when an output from Stage 1 is judged low-quality, the query is escalated to a stronger model. This ensures only hard or low-confidence cases reach the expensive models. On the test datasets, the cascaded system retains 97-99% of the strongest model's accuracy while reducing Time Per Output Token (TPOT). It requires only task-correctness labels and adapts to changes in the model pool without manual reconfiguration.