TurboServe: Atendendo à Geração de Vídeo em Streaming de Forma Eficiente e Econômica
TurboServe: Serving Streaming Video Generation Efficiently and Economically
June 17, 2026
Autores: Youhe Jiang, Haoxu Wang, Haotong Bao, Kai Jiang, Jianfei Chen, Jun Zhu, Fangcheng Fu, Jintao Zhang
cs.AI
Resumo
A geração de vídeo em streaming está emergindo como uma nova carga de trabalho de serviço, na qual os usuários interagem com sessões de longa duração que geram vídeo progressivamente, pedaço por pedaço. Diferentemente da geração de vídeo offline ou do serviço típico de LLM, a geração de vídeo em streaming deve preservar o estado da sessão durante períodos ativos e ociosos, reescalonar sessões em andamento repetidamente e entregar cada pedaço dentro de um limite de latência rigoroso. Isso cria dois desafios principais de serviço em ambientes multi-usuário e multi-GPU: heterogeneidade de duração das sessões, na qual sessões de longa duração tornam as decisões de posicionamento subótimas ao longo do tempo, e heterogeneidade temporal da demanda do usuário, na qual o número de sessões ativas flutua acentuadamente entre picos e períodos ociosos.
Apresentamos o TurboServe, o primeiro sistema de serviço projetado especificamente para cargas de trabalho de geração de vídeo em streaming. O TurboServe formula o serviço como um problema de escalonamento online que coordena conjuntamente o posicionamento das sessões e o provisionamento de GPUs. Seu algoritmo de escalonamento em malha fechada combina um controlador de posicionamento ciente de migração, que reequilibra as sessões entre as GPUs para reduzir a latência máxima por pedaço, com um controlador de escalonamento automático orientado por carga, que adapta o orçamento de GPU à variação da carga de trabalho para melhorar a eficiência de custos. Para apoiar essas decisões em tempo de execução, o TurboServe implementa processamento coalescido de pedaços para agrupar sessões ativas concorrentes na mesma GPU, descarregamento GPU-CPU para suspensão e retomada de sessões e migração GPU-GPU baseada em NCCL para rebalanceamento online. Avaliamos o TurboServe em traços de produção reais da Shengshu Technology, considerando múltiplos tamanhos de modelo e clusters de GPU com até 64 GPUs NVIDIA B300. Em comparação com configurações de serviço de base, o TurboServe reduz a latência por pedaço no pior caso em 37,5% e o custo operacional total da GPU em 37,2%, em média. Nosso código está disponível publicamente em https://github.com/shengshu-ai/TurboServe.
English
Streaming video generation is emerging as a new serving workload in which users interact with long-lived sessions that generate video progressively, chunk by chunk. Unlike offline video generation or typical LLM serving, streaming video generation must preserve session state across active and idle periods, repeatedly schedule ongoing sessions, and deliver each chunk under a tight latency target. This creates two key serving challenges in multi-user, multi-GPU environments: session duration heterogeneity, where long-running sessions make placement decisions suboptimal over time, and temporal user-demand heterogeneity, where the number of active sessions fluctuates sharply across bursts and idle periods.
We present TurboServe, the first serving system designed specifically for streaming video generation workloads. TurboServe formulates serving as an online scheduling problem that jointly coordinates session placement and GPU provisioning. Its closed-loop scheduling algorithm combines a migration-aware placement controller, which rebalances sessions across GPUs to reduce the maximum per-chunk latency, with a load-driven autoscaling controller, which adapts the GPU budget to workload variation for improved cost efficiency. To support these decisions at runtime, TurboServe implements coalesced chunk processing for batching concurrent active sessions on the same GPU, GPU-CPU offloading for session suspension and resumption, and NCCL-based GPU-GPU migration for online rebalancing. We evaluate TurboServe on real-world production traces from Shengshu Technology across multiple model sizes and GPU clusters with up to 64 NVIDIA B300 GPUs. Compared with baseline serving configurations, TurboServe reduces worst-case per-chunk latency by 37.5% and total GPU operating cost by 37.2% on average. Our code is publicly available at https://github.com/shengshu-ai/TurboServe.