ChatPaper.aiChatPaper

Video = Mundo + Flujo de Eventos

Video = World + Event Stream

July 16, 2026
Autores: Lianghua Huang, Zhi-Fan Wu, Yupeng Shi, Wei Wang, Mengyang Feng, Cheng Yu, Chen Liang, Junjie He, Chen-Wei Xie, Yu Liu, Jingren Zhou, Ang Wang, Bang Zhang, Baole Ai, Chongyang Zhong, Jinwei Qi, Kai Zhu, Pandeng Li, Peng Zhang, Wenyuan Zhang, Xinhua Cheng, Yitong Huang, Yun Zheng, Yuxiang Bao, Yuzheng Wang, Zhiwei Lin, Zoubin Bi
cs.AI

Resumen

Presentamos Wan-Streamer v0.3, que redefine nuestro modelo de interacción nativo en streaming bajo una única visión organizadora: un video es un mundo más un flujo de eventos. El mundo es el contexto persistente en el que se desarrolla un video, incluyendo el entorno, la escena, los sujetos, las condiciones acústicas ambientales, las características vocales y otras condiciones relativamente estables. El flujo de eventos es todo lo que cambia con el tiempo dentro de ese mundo, incluyendo cambios en la escena o el entorno, el comportamiento de los sujetos, el habla y otros sonidos. Esto da lugar a una tarea de preentrenamiento de propósito general sobre grandes cantidades de video real: dado un mundo y una entrada entrante, predecir cómo el mundo se mueve, cambia y responde en tiempo real. La competencia resultante puede especializarse en una amplia familia de tareas descendentes en tiempo real. Lo concretamos en la interacción audiovisual full-duplex en tiempo real, donde el flujo de eventos es el habla del agente junto con comportamientos de forma libre. Funcionalmente, el proceso de comprensión multimodal del modelo es similar a visión-lenguaje-acción: mapea la entrada multimodal del usuario en acciones de habla y comportamiento en forma de lenguaje. Wan-Streamer v0.3 conserva el punto de operación de v0.2: video de 640x368 a 25 FPS, una unidad de streaming de 160 ms, una latencia de respuesta del lado del modelo de aproximadamente 200 ms, y una latencia total de interacción de aproximadamente 550 ms bajo un presupuesto de red bidireccional de 350 ms.
English
We present Wan-Streamer v0.3, which reframes our native-streaming interaction model under a single organizing view: a video is a world plus an event stream. The world is the persistent context in which a video unfolds, including the environment, scene, subjects, ambient acoustic conditions, voice characteristics, and other relatively stable conditions. The event stream is everything that changes over time within that world, including scene or environmental changes, subject behavior, speech, and other sounds. This yields a general-purpose pretraining task over large amounts of real video: given a world and incoming input, predict how the world moves, changes, and responds in real time. The resulting competence can be specialized to a broad family of real-time downstream tasks. We instantiate it on real-time full-duplex audio-visual interaction, where the event stream is the agent's speech together with free-form behavior. Functionally, the model's multimodal understanding process is vision-language-action-like: it maps multimodal user input to language-form speech and behavior actions. Wan-Streamer v0.3 preserves the v0.2 operating point: 640x368 video at 25 FPS, a 160 ms streaming unit, approximately 200 ms model-side response latency, and approximately 550 ms total interaction latency under a 350 ms bidirectional network budget.