ChatPaper.aiChatPaper

Wan-Streamer v0.2: Hogere Resolutie, Zelfde Latentie

Wan-Streamer v0.2: Higher Resolution, Same Latency

July 5, 2026
Auteurs: Lianghua Huang, Zhi-Fan Wu, Yupeng Shi, Wei Wang, Mengyang Feng, Junjie He, Chen-Wei Xie, Yu Liu, Jingren Zhou, Ang Wang, Bang Zhang, Baole Ai, Chen Liang, Cheng Yu, Chongyang Zhong, Jinwei Qi, Kai Zhu, Pandeng Li, Peng Zhang, Wenyuan Zhang, Xinhua Cheng, Yitong Huang, Yun Zheng, Yuxiang Bao, Yuzheng Wang, Zoubin Bi
cs.AI

Samenvatting

Wij presenteren Wan-Streamer v0.2, een latentiebehoudende upgrade van het native-streaming, end-to-end audio-visuele interactiemodel. v0.2 behoudt de modelformulering van v0.1, maar verhoogt de interactieve uitvoerstroom van 192x336 naar 640x368, terwijl de modelzijde signaal-naar-signaal latentie van ongeveer 200 ms bij 25 FPS behouden blijft. De hogeresolutiestroom ondersteunt scène-verankerde mid-shot agenten waarvan houding, blik, handen, nabije objecten en lokale scène-indeling herkenbaar blijven tijdens realtime conversatie. Om de grotere visuele stroom te ondersteunen zonder zichtbare vertraging voor de gebruiker, behoudt v0.2 de denker als een enkel-GPU pad met lage latentie voor streaming perceptie, de korte taal-/toestand Transformer-doorgang die de generatiecache opbouwt, en de definitieve decodering. De uitvoerder wordt een multi-GPU Ulysses-stijl context-parallelle groep voor de dure volgende-eenheid latente generatie. Elke uitvoerder-rank schrijft inkomende K/V in een vooraf opgedeelde lokale cache. De lange hoge-resolutie latente videosequentie wordt over de ranks gesplitst voor denoising en verzameld via Ulysses-communicatie, terwijl de veel kortere audio-latente sequentie wordt gegenereerd zonder sequentie-splitsing. In deze splitsing bereikt de taal-/toestandberekening van de denker de uitvoerder alleen als K/V-conditionering, zodat er geen aparte taalsequentie binnen de uitvoerdersgroep gecommuniceerd hoeft te worden. Dit concentreert extra hardware op visuele generatie, terwijl de compacte denker-uitvoerder grens behouden blijft, waardoor de totale interactielatentie op afstand ongeveer 550 ms bedraagt, inclusief een bidirectioneel netwerkbudget van 350 ms.
English
We present Wan-Streamer v0.2, a latency-preserving upgrade of the native-streaming, end-to-end audio-visual interaction model. v0.2 keeps the v0.1 modeling formulation, but raises the interactive output stream from 192x336 to 640x368 while preserving approximately 200 ms model-side signal-to-signal latency at 25 FPS. The higher-resolution stream supports scene-grounded mid-shot agents whose posture, gaze, hands, nearby objects, and local scene layout remain legible during real-time conversation. To support the larger visual stream without adding user-visible delay, v0.2 keeps the thinker as a single-GPU low-latency path for streaming perception, the short language/state Transformer pass that builds the generation cache, and final decoding. The performer becomes a multi-GPU Ulysses-style context-parallel group for the expensive next-unit latent generation. Each performer rank writes incoming K/V into a pre-sharded local cache. The long high-resolution latent video sequence is split across ranks for denoising and gathered through Ulysses communication, while the much shorter audio latent sequence is generated without sequence sharding. In this split, the thinker's language/state computation reaches the performer only as K/V conditioning, so no separate language sequence has to be communicated inside the performer group. This concentrates additional hardware on visual generation while preserving the compact thinker-performer boundary, keeping total remote interaction latency at approximately 550 ms when a 350 ms bidirectional network budget is included.