ChatPaper.aiChatPaper

Wan-Streamer v0.2: Mayor Resolución, Misma Latencia

Wan-Streamer v0.2: Higher Resolution, Same Latency

July 5, 2026
Autores: Lianghua Huang, Zhi-Fan Wu, Yupeng Shi, Wei Wang, Mengyang Feng, Junjie He, Chen-Wei Xie, Yu Liu, Jingren Zhou, Ang Wang, Bang Zhang, Baole Ai, Chen Liang, Cheng Yu, Chongyang Zhong, Jinwei Qi, Kai Zhu, Pandeng Li, Peng Zhang, Wenyuan Zhang, Xinhua Cheng, Yitong Huang, Yun Zheng, Yuxiang Bao, Yuzheng Wang, Zoubin Bi
cs.AI

Resumen

Presentamos Wan-Streamer v0.2, una actualización que preserva la latencia del modelo de interacción audiovisual de extremo a extremo con transmisión nativa. v0.2 mantiene la formulación de modelado de v0.1, pero eleva el flujo de salida interactivo de 192×336 a 640×368 mientras preserva aproximadamente 200 ms de latencia señal a señal del lado del modelo a 25 FPS. El flujo de mayor resolución admite agentes en plano medio contextualizados en la escena, cuya postura, mirada, manos, objetos cercanos y disposición local de la escena se mantienen legibles durante la conversación en tiempo real. Para soportar el flujo visual más grande sin agregar demora visible para el usuario, v0.2 mantiene al thinker como una ruta de baja latencia en una sola GPU para la percepción en streaming, el breve paso de Transformer de lenguaje/estado que construye la caché de generación, y la decodificación final. El performer se convierte en un grupo de paralelismo de contexto estilo Ulysses de múltiples GPU para la costosa generación latente de la siguiente unidad. Cada rango del performer escribe los K/V entrantes en una caché local pre-fragmentada. La larga secuencia de video latente de alta resolución se divide entre los rangos para la eliminación de ruido y se reúne a través de la comunicación Ulysses, mientras que la secuencia de audio latente, mucho más corta, se genera sin fragmentación de secuencias. En esta división, el cómputo de lenguaje/estado del thinker llega al performer solo como condicionamiento K/V, por lo que no es necesario comunicar una secuencia de lenguaje separada dentro del grupo del performer. Esto concentra hardware adicional en la generación visual mientras preserva el límite compacto entre thinker y performer, manteniendo la latencia total de interacción remota en aproximadamente 550 ms cuando se incluye un presupuesto de red bidireccional de 350 ms.
English
We present Wan-Streamer v0.2, a latency-preserving upgrade of the native-streaming, end-to-end audio-visual interaction model. v0.2 keeps the v0.1 modeling formulation, but raises the interactive output stream from 192x336 to 640x368 while preserving approximately 200 ms model-side signal-to-signal latency at 25 FPS. The higher-resolution stream supports scene-grounded mid-shot agents whose posture, gaze, hands, nearby objects, and local scene layout remain legible during real-time conversation. To support the larger visual stream without adding user-visible delay, v0.2 keeps the thinker as a single-GPU low-latency path for streaming perception, the short language/state Transformer pass that builds the generation cache, and final decoding. The performer becomes a multi-GPU Ulysses-style context-parallel group for the expensive next-unit latent generation. Each performer rank writes incoming K/V into a pre-sharded local cache. The long high-resolution latent video sequence is split across ranks for denoising and gathered through Ulysses communication, while the much shorter audio latent sequence is generated without sequence sharding. In this split, the thinker's language/state computation reaches the performer only as K/V conditioning, so no separate language sequence has to be communicated inside the performer group. This concentrates additional hardware on visual generation while preserving the compact thinker-performer boundary, keeping total remote interaction latency at approximately 550 ms when a 350 ms bidirectional network budget is included.