TurboServe: Het efficiënt en economisch leveren van streaming videogeneratie
TurboServe: Serving Streaming Video Generation Efficiently and Economically
June 17, 2026
Auteurs: Youhe Jiang, Haoxu Wang, Haotong Bao, Kai Jiang, Jianfei Chen, Jun Zhu, Fangcheng Fu, Jintao Zhang
cs.AI
Samenvatting
Streaming video generation komt op als een nieuwe serverwerklast waarbij gebruikers interacteren met langdurige sessies die video progressief genereren, chunk voor chunk. In tegenstelling tot offline videogeneratie of typische LLM-serving moet streaming video generation de sessietoestand behouden gedurende actieve en inactieve perioden, lopende sessies herhaaldelijk plannen en elke chunk binnen een strikte latentiedoelstelling leveren. Dit creëert twee belangrijke serveruitdagingen in omgevingen met meerdere gebruikers en meerdere GPU's: heterogeniteit in sessieduur, waarbij langlopende sessies plaatsingsbeslissingen na verloop van tijd suboptimaal maken, en temporele heterogeniteit in gebruikersvraag, waarbij het aantal actieve sessies sterk fluctueert tussen pieken en inactieve perioden.
We presenteren TurboServe, het eerste serversysteem dat specifiek is ontworpen voor streaming video generation-werklasten. TurboServe formuleert serving als een online planningsprobleem dat gezamenlijk sessieplaatsing en GPU-provisionering coördineert. Het closed-loop planningsalgoritme combineert een migratiebewuste plaatsingsregelaar, die sessies herverdeelt over GPU's om de maximale latentie per chunk te verminderen, met een belastingsgestuurde autoscaling-regelaar, die het GPU-budget aanpast aan werklastvariaties voor een betere kostenefficiëntie. Om deze beslissingen tijdens runtime te ondersteunen, implementeert TurboServe samengevoegde chunkverwerking voor het batchen van gelijktijdige actieve sessies op dezelfde GPU, GPU-CPU-offloading voor het onderbreken en hervatten van sessies, en op NCCL gebaseerde GPU-GPU-migratie voor online herverdeling. We evalueren TurboServe op real-world productietraces van Shengshu Technology over meerdere modelgroottes en GPU-clusters met maximaal 64 NVIDIA B300 GPU's. Vergeleken met basislijnserverconfiguraties vermindert TurboServe de worst-case latentie per chunk met 37,5% en de totale GPU-bedrijfskosten met gemiddeld 37,2%. Onze code is openbaar beschikbaar op https://github.com/shengshu-ai/TurboServe.
English
Streaming video generation is emerging as a new serving workload in which users interact with long-lived sessions that generate video progressively, chunk by chunk. Unlike offline video generation or typical LLM serving, streaming video generation must preserve session state across active and idle periods, repeatedly schedule ongoing sessions, and deliver each chunk under a tight latency target. This creates two key serving challenges in multi-user, multi-GPU environments: session duration heterogeneity, where long-running sessions make placement decisions suboptimal over time, and temporal user-demand heterogeneity, where the number of active sessions fluctuates sharply across bursts and idle periods.
We present TurboServe, the first serving system designed specifically for streaming video generation workloads. TurboServe formulates serving as an online scheduling problem that jointly coordinates session placement and GPU provisioning. Its closed-loop scheduling algorithm combines a migration-aware placement controller, which rebalances sessions across GPUs to reduce the maximum per-chunk latency, with a load-driven autoscaling controller, which adapts the GPU budget to workload variation for improved cost efficiency. To support these decisions at runtime, TurboServe implements coalesced chunk processing for batching concurrent active sessions on the same GPU, GPU-CPU offloading for session suspension and resumption, and NCCL-based GPU-GPU migration for online rebalancing. We evaluate TurboServe on real-world production traces from Shengshu Technology across multiple model sizes and GPU clusters with up to 64 NVIDIA B300 GPUs. Compared with baseline serving configurations, TurboServe reduces worst-case per-chunk latency by 37.5% and total GPU operating cost by 37.2% on average. Our code is publicly available at https://github.com/shengshu-ai/TurboServe.