Vidu S1: 실시간 대화형 비디오 생성 모델
Vidu S1: A Real-Time Interactive Video Generation Model
July 3, 2026
저자: Jintao Zhang, Kai Jiang, Jintao Chen, Xu Wang, Yang Luo, Yuji Wang, Dechuang Chen, Jungang Li, Chengyang Ye, Marco Chen, Hongzhou Zhu, Min Zhao, Yuxuan Jiang, Zhengkun Huang, Chendong Xiang, Kaiwen Zheng, Haoxu Wang, Xiaohang Wang, Qi Jia, Xin Chen, Yimin Chen, Youhe Jiang, Fangcheng Fu, Zhijie Deng, Fan Bao, Jianfei Chen, Jun Zhu
cs.AI
초록
우리는 디지털 캐릭터의 음성 제어를 지원하는 실시간 대화형 비디오 생성 모델인 Vidu S1을 소개합니다. 사용자는 음성 명령을 통해 언제든지 비디오 생성 콘텐츠를 제어할 수 있습니다. Vidu S1은 흐림, 드리프트 또는 시각적 왜곡 없이 무제한 길이의 실시간 비디오 생성을 지원합니다. TurboDiffusion과 TurboServe로 구축된 Vidu S1은 일반 소비자 GPU에서 최대 42 FPS로 540p 실시간 비디오를 출력합니다. 사용자는 실제 인물, 애니메이션, 반려동물의 맞춤 이미지를 업로드하고 다양한 음성 톤을 선택하여 개인화된 경험을 할 수 있습니다. 실험 결과 Vidu S1은 실시간 추론 요구 사항을 완전히 충족하면서 모든 테스트 지표에서 최고의 성능을 달성함을 보여줍니다. 플레이 가능한 온라인 데모는 https://vidu.com/vidu-stream에서 제공됩니다.
English
We introduce Vidu S1, a real-time interactive video generation model supporting voice control of digital characters. Users can control video generation content at any moment through voice instructions. Vidu S1 supports infinite-length real-time video generation without blurring, drift, or visual distortion. Built with TurboDiffusion and TurboServe, Vidu S1 outputs 540p real-time videos at up to 42 FPS on regular consumer GPUs. Users can upload custom images of real people, anime, and pets, and choose different voice tones for personalized experiences. Experiments show that Vidu S1 achieves the best performance across all test metrics while fully meeting real-time inference requirements. A playable online demo is available at https://vidu.com/vidu-stream.