Видео = Мир + Поток событий
Video = World + Event Stream
July 16, 2026
Авторы: Lianghua Huang, Zhi-Fan Wu, Yupeng Shi, Wei Wang, Mengyang Feng, Cheng Yu, Chen Liang, Junjie He, Chen-Wei Xie, Yu Liu, Jingren Zhou, Ang Wang, Bang Zhang, Baole Ai, Chongyang Zhong, Jinwei Qi, Kai Zhu, Pandeng Li, Peng Zhang, Wenyuan Zhang, Xinhua Cheng, Yitong Huang, Yun Zheng, Yuxiang Bao, Yuzheng Wang, Zhiwei Lin, Zoubin Bi
cs.AI
Аннотация
Мы представляем Wan-Streamer v0.3, который переосмысляет нашу модель нативной стриминговой интеракции в рамках единой организующей концепции: видео — это мир плюс поток событий. Мир представляет собой устойчивый контекст, в котором разворачивается видео, включая окружение, сцену, субъекты, акустические условия окружающей среды, характеристики голоса и другие относительно стабильные условия. Поток событий — это всё, что изменяется со временем в рамках этого мира, включая изменения сцены или окружения, поведение субъектов, речь и другие звуки. Это порождает универсальную задачу предобучения на больших объёмах реального видео: имея мир и входящие данные, предсказывать, как мир движется, изменяется и реагирует в реальном времени. Полученная компетенция может быть специализирована для широкого семейства задач реального времени с последующей донастройкой. Мы реализуем её в режиме реального времени для полноценной дуплексной аудиовизуальной интеракции, где поток событий представляет собой речь агента вместе со свободно формируемым поведением. Функционально процесс мультимодального понимания модели подобен модели «зрение-язык-действие»: он преобразует мультимодальный ввод пользователя в речевые и поведенческие действия в языковой форме. Wan-Streamer v0.3 сохраняет рабочие точки v0.2: видео 640×368 при 25 кадрах/с, единица потоковой передачи 160 мс, задержка ответа модели около 200 мс и общая задержка взаимодействия около 550 мс при двунаправленном сетевом бюджете 350 мс.
English
We present Wan-Streamer v0.3, which reframes our native-streaming interaction model under a single organizing view: a video is a world plus an event stream. The world is the persistent context in which a video unfolds, including the environment, scene, subjects, ambient acoustic conditions, voice characteristics, and other relatively stable conditions. The event stream is everything that changes over time within that world, including scene or environmental changes, subject behavior, speech, and other sounds. This yields a general-purpose pretraining task over large amounts of real video: given a world and incoming input, predict how the world moves, changes, and responds in real time. The resulting competence can be specialized to a broad family of real-time downstream tasks. We instantiate it on real-time full-duplex audio-visual interaction, where the event stream is the agent's speech together with free-form behavior. Functionally, the model's multimodal understanding process is vision-language-action-like: it maps multimodal user input to language-form speech and behavior actions. Wan-Streamer v0.3 preserves the v0.2 operating point: 640x368 video at 25 FPS, a 160 ms streaming unit, approximately 200 ms model-side response latency, and approximately 550 ms total interaction latency under a 350 ms bidirectional network budget.