ChatPaper.aiChatPaper

Vidéo = monde + flux d'événements

Video = World + Event Stream

July 16, 2026
Auteurs: Lianghua Huang, Zhi-Fan Wu, Yupeng Shi, Wei Wang, Mengyang Feng, Cheng Yu, Chen Liang, Junjie He, Chen-Wei Xie, Yu Liu, Jingren Zhou, Ang Wang, Bang Zhang, Baole Ai, Chongyang Zhong, Jinwei Qi, Kai Zhu, Pandeng Li, Peng Zhang, Wenyuan Zhang, Xinhua Cheng, Yitong Huang, Yun Zheng, Yuxiang Bao, Yuzheng Wang, Zhiwei Lin, Zoubin Bi
cs.AI

Résumé

Nous présentons Wan-Streamer v0.3, qui réorganise notre modèle d'interaction en continu natif autour d'une vision unificatrice : une vidéo est un monde auquel s'ajoute un flux d'événements. Le monde constitue le contexte persistant dans lequel se déroule la vidéo, incluant l'environnement, la scène, les sujets, les conditions acoustiques ambiantes, les caractéristiques vocales et d'autres éléments relativement stables. Le flux d'événements regroupe tout ce qui évolue au fil du temps au sein de ce monde, notamment les changements de scène ou d'environnement, le comportement des sujets, la parole et autres sons. Cela conduit à une tâche de pré-entraînement généraliste sur de grandes quantités de vidéos réelles : à partir d'un monde et d'une entrée entrante, prédire comment le monde se déplace, se transforme et réagit en temps réel. La compétence ainsi acquise peut être spécialisée pour une vaste famille de tâches temps réel en aval. Nous l'instancions sur l'interaction audiovisuelle en full-duplex en temps réel, où le flux d'événements correspond à la parole de l'agent ainsi qu'à des comportements libres. Fonctionnellement, le processus de compréhension multimodale du modèle est de type vision-langage-action : il transforme les entrées utilisateur multimodales en actions de parole et de comportement sous forme langagière. Wan-Streamer v0.3 conserve le point de fonctionnement de la v0.2 : vidéo 640×368 à 25 images/s, une unité de streaming de 160 ms, une latence de réponse côté modèle d'environ 200 ms, et une latence d'interaction totale d'environ 550 ms avec un budget réseau bidirectionnel de 350 ms.
English
We present Wan-Streamer v0.3, which reframes our native-streaming interaction model under a single organizing view: a video is a world plus an event stream. The world is the persistent context in which a video unfolds, including the environment, scene, subjects, ambient acoustic conditions, voice characteristics, and other relatively stable conditions. The event stream is everything that changes over time within that world, including scene or environmental changes, subject behavior, speech, and other sounds. This yields a general-purpose pretraining task over large amounts of real video: given a world and incoming input, predict how the world moves, changes, and responds in real time. The resulting competence can be specialized to a broad family of real-time downstream tasks. We instantiate it on real-time full-duplex audio-visual interaction, where the event stream is the agent's speech together with free-form behavior. Functionally, the model's multimodal understanding process is vision-language-action-like: it maps multimodal user input to language-form speech and behavior actions. Wan-Streamer v0.3 preserves the v0.2 operating point: 640x368 video at 25 FPS, a 160 ms streaming unit, approximately 200 ms model-side response latency, and approximately 550 ms total interaction latency under a 350 ms bidirectional network budget.