Video = Wereld + Gebeurtenisstroom
Video = World + Event Stream
July 16, 2026
Auteurs: Lianghua Huang, Zhi-Fan Wu, Yupeng Shi, Wei Wang, Mengyang Feng, Cheng Yu, Chen Liang, Junjie He, Chen-Wei Xie, Yu Liu, Jingren Zhou, Ang Wang, Bang Zhang, Baole Ai, Chongyang Zhong, Jinwei Qi, Kai Zhu, Pandeng Li, Peng Zhang, Wenyuan Zhang, Xinhua Cheng, Yitong Huang, Yun Zheng, Yuxiang Bao, Yuzheng Wang, Zhiwei Lin, Zoubin Bi
cs.AI
Samenvatting
We presenteren Wan-Streamer v0.3, dat ons native-streaming-interactiemodel herformuleert vanuit één enkel organiserend perspectief: een video is een wereld plus een gebeurtenissenstroom. De wereld is de persistente context waarin een video zich ontvouwt, met inbegrip van de omgeving, het tafereel, de subjecten, de akoestische omstandigheden, stemkarakteristieken en andere relatief stabiele condities. De gebeurtenissenstroom omvat alles wat in de loop van de tijd binnen die wereld verandert, zoals veranderingen in het tafereel of de omgeving, subjectgedrag, spraak en andere geluiden. Dit levert een general-purpose-voortrainingstaak op over grote hoeveelheden echte video: gegeven een wereld en inkomende input, voorspel hoe de wereld beweegt, verandert en in real-time reageert. De resulterende competentie kan worden gespecialiseerd voor een brede familie van real-time downstream-taken. We implementeren dit in real-time full-duplex audiovisuele interactie, waarbij de gebeurtenissenstroom de spraak van de agent is, samen met vrij gedrag. Functioneel gezien is het multimodale begripsproces van het model visie-taal-actie-achtig: het brengt multimodale gebruikersinput in kaart naar taalvormige spraak- en gedragsacties. Wan-Streamer v0.3 behoudt het werkpunt van v0.2: 640x368 video bij 25 FPS, een streaming-eenheid van 160 ms, een responstijd aan modelzijde van circa 200 ms, en een totale interactielatentie van circa 550 ms onder een bidirectioneel netwerkbudget van 350 ms.
English
We present Wan-Streamer v0.3, which reframes our native-streaming interaction model under a single organizing view: a video is a world plus an event stream. The world is the persistent context in which a video unfolds, including the environment, scene, subjects, ambient acoustic conditions, voice characteristics, and other relatively stable conditions. The event stream is everything that changes over time within that world, including scene or environmental changes, subject behavior, speech, and other sounds. This yields a general-purpose pretraining task over large amounts of real video: given a world and incoming input, predict how the world moves, changes, and responds in real time. The resulting competence can be specialized to a broad family of real-time downstream tasks. We instantiate it on real-time full-duplex audio-visual interaction, where the event stream is the agent's speech together with free-form behavior. Functionally, the model's multimodal understanding process is vision-language-action-like: it maps multimodal user input to language-form speech and behavior actions. Wan-Streamer v0.3 preserves the v0.2 operating point: 640x368 video at 25 FPS, a 160 ms streaming unit, approximately 200 ms model-side response latency, and approximately 550 ms total interaction latency under a 350 ms bidirectional network budget.