ChatPaper.aiChatPaper

Wan-Streamer v0.1: Modelos Fundacionais Interativos em Tempo Real de Fim a Fim

Wan-Streamer v0.1: End-to-end Real-time Interactive Foundation Models

June 23, 2026
Autores: Lianghua Huang, Zhifan Wu, Wei Wang, Yupeng Shi, Mengyang Feng, Junjie He, Chenwei Xie, Yu Liu, Jingren Zhou, Ang Wang, Bang Zhang, Baole Ai, Chen Liang, Cheng Yu, Chongyang Zhong, Jinwei Qi, Kai Zhu, Pandeng Li, Peng Zhang, Wenyuan Zhang, Xinhua Cheng, Yitong Huang, Yun Zheng, Zoubin Bi
cs.AI

Resumo

Apresentamos o Wan-Streamer, um modelo fundamental interativo nativo de streaming, ponta a ponta, projetado desde o início para interação audiovisual full-duplex, em tempo real e de baixa latência. O Wan-Streamer modela perfeitamente linguagem, áudio e vídeo como entrada e saída dentro de um único Transformer, onde a sequência é representada como tokens de entrada visuais, de áudio e de texto entrelaçados, juntamente com tokens de saída visuais, de áudio e de texto, coordenados por atenção bloco-causal para streaming incremental. Diferentemente de sistemas interativos em cascata que dependem de módulos separados de VAD, ASR, linguagem, TTS, animação guiada por áudio ou geração de vídeo, o Wan-Streamer não depende de módulos externos de linguagem, fala, avatar ou geração de vídeo: percepção, raciocínio, geração, temporização da resposta, gerenciamento de turno e sincronização cross-modal são aprendidos conjuntamente dentro de um único modelo unificado, reduzindo a latência do pipeline e o acúmulo de erros. Para suportar responsividade audiovisual natural, redesenhamos toda a pilha em torno da capacidade de streaming, incluindo codificadores causais, decodificadores causais, atenção bloco-causal e agendamento de tokens multimodais de baixa latência, permitindo unidades de streaming tão curtas quanto 160 ms a 25 fps. O Wan-Streamer alcança aproximadamente 200 ms de latência de resposta no modelo e aproximadamente 550 ms de latência total de interação quando combinado com 350 ms de latência bidirecional de rede, suportando comunicação audiovisual full-duplex abaixo de um segundo. Esses resultados posicionam o Wan-Streamer como um modelo fundamental interativo multimodal unificado e ponta a ponta para interação de streaming de baixa latência.
English
We present Wan-Streamer, a native-streaming, end-to-end interactive foundation model designed from the ground up for real-time, low-latency, full-duplex audio-visual interaction. Wan-Streamer seamlessly models language, audio, and video as both input and output within a single Transformer, where the sequence is represented as interleaved visual, audio, and text input tokens together with visual, audio, and text output tokens, coordinated by block-causal attention for incremental streaming. Unlike cascaded interactive systems that rely on separate VAD, ASR, language, TTS, audio-driven animation, or video-generation modules, Wan-Streamer does not rely on external language, speech, avatar, or video-generation modules: perception, reasoning, generation, response timing, turn management, and cross-modal synchronization are learned jointly within one unified model, reducing pipeline latency and error accumulation. To support natural audio-visual responsiveness, we redesign the entire stack around streamability, including causal encoders, causal decoders, block-causal attention, and low-latency multimodal token scheduling, enabling streaming units as short as 160 ms at 25 fps. Wan-Streamer achieves approximately 200 ms model-side response latency and approximately 550 ms total interaction latency when combined with 350 ms bidirectional network latency, supporting sub-second duplex audio-visual communication. These results position Wan-Streamer as a unified, end-to-end, multimodal interactive foundation model for low-latency streaming interaction.