ChatPaper.aiChatPaper

Wan-Streamer v0.2: Более высокое разрешение, та же задержка

Wan-Streamer v0.2: Higher Resolution, Same Latency

July 5, 2026
Авторы: Lianghua Huang, Zhi-Fan Wu, Yupeng Shi, Wei Wang, Mengyang Feng, Junjie He, Chen-Wei Xie, Yu Liu, Jingren Zhou, Ang Wang, Bang Zhang, Baole Ai, Chen Liang, Cheng Yu, Chongyang Zhong, Jinwei Qi, Kai Zhu, Pandeng Li, Peng Zhang, Wenyuan Zhang, Xinhua Cheng, Yitong Huang, Yun Zheng, Yuxiang Bao, Yuzheng Wang, Zoubin Bi
cs.AI

Аннотация

Представляем Wan-Streamer v0.2 — обновление с сохранением задержки для сквозной аудиовизуальной модели взаимодействия с нативной потоковой передачей. Версия v0.2 сохраняет формулировку модели v0.1, но повышает разрешение выходного интерактивного потока с 192×336 до 640×368, сохраняя задержку сигнал-сигнал на стороне модели порядка 200 мс при 25 FPS. Поток более высокого разрешения поддерживает агентов среднего плана, привязанных к сцене, чьи поза, взгляд, руки, близлежащие объекты и локальный план сцены остаются различным в ходе диалога в реальном времени. Для поддержки увеличенного визуального потока без добавления заметной для пользователя задержки v0.2 сохраняет «мыслитель» (thinker) как одногпу путь с низкой задержкой для потокового восприятия, короткий проход трансформера для языка/состояния, формирующий кэш генерации, и финальное декодирование. «Исполнитель» (performer) превращается в многогпу группу контекстного параллелизма в стиле Ulysses для ресурсоемкой латентной генерации следующего элемента. Каждый ранг исполнителя записывает входящие K/V в предварительно шардированный локальный кэш. Длинная латентная видеопоследовательность высокого разрешения разделяется между рангами для шумоподавления и собирается через коммуникацию Ulysses, в то время как значительно более короткая аудиолатентная последовательность генерируется без шардирования последовательности. В таком разделении вычисления языка/состояния мыслителя достигают исполнителя только в виде K/V-обусловливания, поэтому внутри группы исполнителя не требуется передавать отдельную языковую последовательность. Это концентрирует дополнительные аппаратные ресурсы на визуальной генерации, сохраняя компактную границу между мыслителем и исполнителем, что обеспечивает суммарную задержку удаленного взаимодействия порядка 550 мс с учетом выделенных 350 мс на двунаправленное сетевое взаимодействие.
English
We present Wan-Streamer v0.2, a latency-preserving upgrade of the native-streaming, end-to-end audio-visual interaction model. v0.2 keeps the v0.1 modeling formulation, but raises the interactive output stream from 192x336 to 640x368 while preserving approximately 200 ms model-side signal-to-signal latency at 25 FPS. The higher-resolution stream supports scene-grounded mid-shot agents whose posture, gaze, hands, nearby objects, and local scene layout remain legible during real-time conversation. To support the larger visual stream without adding user-visible delay, v0.2 keeps the thinker as a single-GPU low-latency path for streaming perception, the short language/state Transformer pass that builds the generation cache, and final decoding. The performer becomes a multi-GPU Ulysses-style context-parallel group for the expensive next-unit latent generation. Each performer rank writes incoming K/V into a pre-sharded local cache. The long high-resolution latent video sequence is split across ranks for denoising and gathered through Ulysses communication, while the much shorter audio latent sequence is generated without sequence sharding. In this split, the thinker's language/state computation reaches the performer only as K/V conditioning, so no separate language sequence has to be communicated inside the performer group. This concentrates additional hardware on visual generation while preserving the compact thinker-performer boundary, keeping total remote interaction latency at approximately 550 ms when a 350 ms bidirectional network budget is included.