ChatPaper.aiChatPaper

Stream-T1: Escalonamento em Tempo de Teste para Geração de Vídeo em Fluxo Contínuo

Stream-T1: Test-Time Scaling for Streaming Video Generation

May 6, 2026
Autores: Yijing Tu, Shaojin Wu, Mengqi Huang, Wenchuan Wang, Yuxin Wang, Chunxiao Liu, Zhendong Mao
cs.AI

Resumo

Embora o Test-Time Scaling (TTS) ofereça uma direção promissora para aprimorar a geração de vídeo sem os custos crescentes do treinamento, os métodos atuais de geração de vídeo em tempo de teste baseados em modelos de difusão sofrem com custos exorbitantes de exploração de candidatos e carecem de orientação temporal. Para enfrentar esses gargalos estruturais, propomos mudar o foco para a geração de vídeo em *streaming*. Identificamos que sua síntese em nível de *chunk* e poucas etapas de desruído são intrinsecamente adequadas para o TTS, reduzindo significativamente a sobrecarga computacional enquanto permitem um controle temporal refinado. Motivados por esta percepção, introduzimos o Stream-T1, um pioneiro e abrangente framework de TTS exclusivamente adaptado para a geração de vídeo em *streaming*. Especificamente, o Stream-T1 é composto por três unidades: (1) **Propagação de Ruído em Escala de *Stream***, que refina ativamente o ruído latente inicial do *chunk* em geração utilizando o ruído do *chunk* anterior historicamente comprovado e de alta qualidade, estabelecendo efetivamente a dependência temporal e utilizando o prior gaussiano histórico para orientar a geração atual; (2) **Poda por Recompensa em Escala de *Stream***, que avalia de forma abrangente os candidatos gerados para encontrar um equilíbrio ideal entre a estética espacial local e a coerência temporal global, integrando avaliações imediatas de curto prazo com avaliações de longo prazo baseadas em janela deslizante; (3) **Descarte de Memória em Escala de *Stream***, que encaminha dinamicamente o contexto expulso do *KV-cache* para diferentes caminhos de atualização guiados pelo *feedback* de recompensa, garantindo que as informações visuais previamente geradas ancoram e orientem efetivamente o fluxo de vídeo subsequente. Avaliado em *benchmarks* abrangentes de vídeo de 5s e 30s, o Stream-T1 demonstra uma superioridade notável, melhorando significativamente a consistência temporal, a suavidade do movimento e a qualidade visual a nível de *frame*.
English
While Test-Time Scaling (TTS) offers a promising direction to enhance video generation without the surging costs of training, current test-time video generation methods based on diffusion models suffer from exorbitant candidate exploration costs and lack temporal guidance. To address these structural bottlenecks, we propose shifting the focus to streaming video generation. We identify that its chunk-level synthesis and few denoising steps are intrinsically suited for TTS, significantly lowering computational overhead while enabling fine-grained temporal control. Driven by this insight, we introduced Stream-T1, a pioneering comprehensive TTS framework exclusively tailored for streaming video generation. Specifically, Stream-T1 is composed of three units: (1) Stream -Scaled Noise Propagation, which actively refines the initial latent noise of the generating chunk using historically proven, high-quality previous chunk noise, effectively establishes temporal dependency and utilizing the historical Gaussian prior to guide the current generation; (2) Stream -Scaled Reward Pruning, which comprehensively evaluates generated candidates to strike an optimal balance between local spatial aesthetics and global temporal coherence by integrating immediate short-term assessments with sliding-window-based long-term evaluations; (3) Stream-Scaled Memory Sinking, which dynamically routes the context evicted from KV-cache into distinct updating pathways guided by the reward feedback, ensuring that previously generated visual information effectively anchors and guides the subsequent video stream. Evaluated on both 5s and 30s comprehensive video benchmarks, Stream-T1 demonstrates profound superiority, significantly improving temporal consistency, motion smoothness, and frame-level visual quality.