ChatPaper.aiChatPaper

Video = Welt + Ereignisstrom

Video = World + Event Stream

July 16, 2026
Autoren: Lianghua Huang, Zhi-Fan Wu, Yupeng Shi, Wei Wang, Mengyang Feng, Cheng Yu, Chen Liang, Junjie He, Chen-Wei Xie, Yu Liu, Jingren Zhou, Ang Wang, Bang Zhang, Baole Ai, Chongyang Zhong, Jinwei Qi, Kai Zhu, Pandeng Li, Peng Zhang, Wenyuan Zhang, Xinhua Cheng, Yitong Huang, Yun Zheng, Yuxiang Bao, Yuzheng Wang, Zhiwei Lin, Zoubin Bi
cs.AI

Zusammenfassung

Wir präsentieren Wan-Streamer v0.3, der unser systemeigenes Streaming-Interaktionsmodell unter einer einheitlichen Betrachtungsweise neu kontextualisiert: Ein Video ist eine Welt plus ein Ereignisstrom. Die Welt ist der beständige Kontext, in dem ein Video abläuft, einschließlich Umgebung, Szene, Subjekte, akustische Umgebungsbedingungen, Stimmcharakteristiken und andere relativ stabile Gegebenheiten. Der Ereignisstrom umfasst alles, was sich im Laufe der Zeit innerhalb dieser Welt verändert, darunter Szenen- oder Umgebungsänderungen, Subjektverhalten, Sprache und andere Geräusche. Dies ergibt eine universelle Vortrainingsaufgabe anhand großer Mengen realer Videodaten: Bei gegebener Welt und eingehendem Input vorhersagen, wie sich die Welt in Echtzeit bewegt, verändert und reagiert. Die daraus resultierende Kompetenz kann für eine breite Familie von Echtzeit-Downstream-Aufgaben spezialisiert werden. Wir setzen dies für die vollduplexe audio-visuelle Echtzeitinteraktion um, bei der der Ereignisstrom aus der Sprache des Agenten sowie freiem Verhalten besteht. Funktionell ähnelt der multimodale Verarbeitungsprozess des Modells einem Vision-Language-Action-Ansatz: Es kartiert multimodalen Benutzereingaben in sprachförmige Sprach- und Verhaltensaktionen. Wan-Streamer v0.3 behält den Betriebspunkt von v0.2 bei: 640×368 Video bei 25 FPS, eine Streamingeinheit von 160 ms, eine modellseitige Antwortlatenz von etwa 200 ms und eine gesamte Interaktionslatenz von etwa 550 ms bei einem bidirektionalen Netzwerkbudget von 350 ms.
English
We present Wan-Streamer v0.3, which reframes our native-streaming interaction model under a single organizing view: a video is a world plus an event stream. The world is the persistent context in which a video unfolds, including the environment, scene, subjects, ambient acoustic conditions, voice characteristics, and other relatively stable conditions. The event stream is everything that changes over time within that world, including scene or environmental changes, subject behavior, speech, and other sounds. This yields a general-purpose pretraining task over large amounts of real video: given a world and incoming input, predict how the world moves, changes, and responds in real time. The resulting competence can be specialized to a broad family of real-time downstream tasks. We instantiate it on real-time full-duplex audio-visual interaction, where the event stream is the agent's speech together with free-form behavior. Functionally, the model's multimodal understanding process is vision-language-action-like: it maps multimodal user input to language-form speech and behavior actions. Wan-Streamer v0.3 preserves the v0.2 operating point: 640x368 video at 25 FPS, a 160 ms streaming unit, approximately 200 ms model-side response latency, and approximately 550 ms total interaction latency under a 350 ms bidirectional network budget.