ChatPaper.aiChatPaper

Wan-Streamer v0.2 : Résolution plus élevée, même latence

Wan-Streamer v0.2: Higher Resolution, Same Latency

July 5, 2026
Auteurs: Lianghua Huang, Zhi-Fan Wu, Yupeng Shi, Wei Wang, Mengyang Feng, Junjie He, Chen-Wei Xie, Yu Liu, Jingren Zhou, Ang Wang, Bang Zhang, Baole Ai, Chen Liang, Cheng Yu, Chongyang Zhong, Jinwei Qi, Kai Zhu, Pandeng Li, Peng Zhang, Wenyuan Zhang, Xinhua Cheng, Yitong Huang, Yun Zheng, Yuxiang Bao, Yuzheng Wang, Zoubin Bi
cs.AI

Résumé

Nous présentons Wan-Streamer v0.2, une mise à jour préservant la latence du modèle natif de streaming d'interaction audio-visuelle de bout en bout. v0.2 conserve la formulation de modélisation de v0.1, mais élève le flux de sortie interactif de 192×336 à 640×368 tout en maintenant une latence signal-à-signal côté modèle d'environ 200 ms à 25 FPS. Le flux haute résolution prend en charge des agents en plan moyen ancrés dans la scène, dont la posture, le regard, les mains, les objets proches et l'agencement local de la scène restent lisibles pendant une conversation en temps réel. Pour prendre en charge le flux visuel plus large sans ajouter de délai perceptible par l'utilisateur, v0.2 conserve le *thinker* comme chemin à faible latence sur un seul GPU pour la perception en continu, le court passage du transformateur langage/état qui construit le cache de génération, et le décodage final. Le *performer* devient un groupe parallèle de contexte multi-GPU de style Ulysses pour la coûteuse génération latente de la prochaine unité. Chaque rang du *performer* écrit les K/V entrants dans un cache local pré-divisé. La longue séquence latente vidéo haute résolution est répartie entre les rangs pour le débruitage et rassemblée via la communication Ulysses, tandis que la séquence latente audio, beaucoup plus courte, est générée sans division de séquence. Dans cette répartition, le calcul langage/état du *thinker* n'atteint le *performer* que sous forme de conditionnement K/V, de sorte qu'aucune séquence de langage séparée n'a besoin d'être communiquée à l'intérieur du groupe *performer*. Cela concentre le matériel supplémentaire sur la génération visuelle tout en préservant la frontière compacte *thinker-performer*, maintenant la latence totale d'interaction distante à environ 550 ms lorsqu'un budget réseau bidirectionnel de 350 ms est inclus.
English
We present Wan-Streamer v0.2, a latency-preserving upgrade of the native-streaming, end-to-end audio-visual interaction model. v0.2 keeps the v0.1 modeling formulation, but raises the interactive output stream from 192x336 to 640x368 while preserving approximately 200 ms model-side signal-to-signal latency at 25 FPS. The higher-resolution stream supports scene-grounded mid-shot agents whose posture, gaze, hands, nearby objects, and local scene layout remain legible during real-time conversation. To support the larger visual stream without adding user-visible delay, v0.2 keeps the thinker as a single-GPU low-latency path for streaming perception, the short language/state Transformer pass that builds the generation cache, and final decoding. The performer becomes a multi-GPU Ulysses-style context-parallel group for the expensive next-unit latent generation. Each performer rank writes incoming K/V into a pre-sharded local cache. The long high-resolution latent video sequence is split across ranks for denoising and gathered through Ulysses communication, while the much shorter audio latent sequence is generated without sequence sharding. In this split, the thinker's language/state computation reaches the performer only as K/V conditioning, so no separate language sequence has to be communicated inside the performer group. This concentrates additional hardware on visual generation while preserving the compact thinker-performer boundary, keeping total remote interaction latency at approximately 550 ms when a 350 ms bidirectional network budget is included.