Wan-Streamer v0.2: Maior Resolução, Mesma Latência
Wan-Streamer v0.2: Higher Resolution, Same Latency
July 5, 2026
Autores: Lianghua Huang, Zhi-Fan Wu, Yupeng Shi, Wei Wang, Mengyang Feng, Junjie He, Chen-Wei Xie, Yu Liu, Jingren Zhou, Ang Wang, Bang Zhang, Baole Ai, Chen Liang, Cheng Yu, Chongyang Zhong, Jinwei Qi, Kai Zhu, Pandeng Li, Peng Zhang, Wenyuan Zhang, Xinhua Cheng, Yitong Huang, Yun Zheng, Yuxiang Bao, Yuzheng Wang, Zoubin Bi
cs.AI
Resumo
Apresentamos o Wan-Streamer v0.2, uma atualização que preserva a latência do modelo nativo de streaming para interação audiovisual fim a fim. O v0.2 mantém a formulação de modelagem do v0.1, mas eleva o fluxo de saída interativo de 192x336 para 640x368, preservando aproximadamente 200 ms de latência sinal a sinal do lado do modelo a 25 FPS. O fluxo de maior resolução suporta agentes de plano médio ancorados na cena, cuja postura, olhar, mãos, objetos próximos e layout local da cena permanecem legíveis durante conversas em tempo real. Para suportar o fluxo visual maior sem adicionar atraso perceptível ao usuário, o v0.2 mantém o "thinker" como um caminho de baixa latência em uma única GPU para percepção em streaming, a passagem curta do Transformer de linguagem/estado que constrói o cache de geração, e a decodificação final. O "performer" torna-se um grupo paralelo de contexto ao estilo Ulysses com múltiplas GPUs para a cara geração latente da próxima unidade. Cada rank do performer escreve os K/V recebidos em um cache local pré-fracionado. A longa sequência de vídeo latente de alta resolução é dividida entre os ranks para remoção de ruído e agregada por comunicação Ulysses, enquanto a sequência de áudio latente, muito mais curta, é gerada sem fragmentação de sequência. Nessa divisão, o cálculo de linguagem/estado do thinker chega ao performer apenas como condicionamento K/V, de modo que nenhuma sequência de linguagem separada precisa ser comunicada dentro do grupo do performer. Isso concentra hardware adicional na geração visual, preservando ao mesmo tempo a fronteira compacta thinker-performer, mantendo a latência total de interação remota em aproximadamente 550 ms quando um orçamento de rede bidirecional de 350 ms é incluído.
English
We present Wan-Streamer v0.2, a latency-preserving upgrade of the native-streaming, end-to-end audio-visual interaction model. v0.2 keeps the v0.1 modeling formulation, but raises the interactive output stream from 192x336 to 640x368 while preserving approximately 200 ms model-side signal-to-signal latency at 25 FPS. The higher-resolution stream supports scene-grounded mid-shot agents whose posture, gaze, hands, nearby objects, and local scene layout remain legible during real-time conversation. To support the larger visual stream without adding user-visible delay, v0.2 keeps the thinker as a single-GPU low-latency path for streaming perception, the short language/state Transformer pass that builds the generation cache, and final decoding. The performer becomes a multi-GPU Ulysses-style context-parallel group for the expensive next-unit latent generation. Each performer rank writes incoming K/V into a pre-sharded local cache. The long high-resolution latent video sequence is split across ranks for denoising and gathered through Ulysses communication, while the much shorter audio latent sequence is generated without sequence sharding. In this split, the thinker's language/state computation reaches the performer only as K/V conditioning, so no separate language sequence has to be communicated inside the performer group. This concentrates additional hardware on visual generation while preserving the compact thinker-performer boundary, keeping total remote interaction latency at approximately 550 ms when a 350 ms bidirectional network budget is included.