ChatPaper.aiChatPaper

Vidu S1: リアルタイムインタラクティブ動画生成モデル

Vidu S1: A Real-Time Interactive Video Generation Model

July 3, 2026
著者: Jintao Zhang, Kai Jiang, Jintao Chen, Xu Wang, Yang Luo, Yuji Wang, Dechuang Chen, Jungang Li, Chengyang Ye, Marco Chen, Hongzhou Zhu, Min Zhao, Yuxuan Jiang, Zhengkun Huang, Chendong Xiang, Kaiwen Zheng, Haoxu Wang, Xiaohang Wang, Qi Jia, Xin Chen, Yimin Chen, Youhe Jiang, Fangcheng Fu, Zhijie Deng, Fan Bao, Jianfei Chen, Jun Zhu
cs.AI

要旨

Vidu S1は、デジタルキャラクターの音声制御に対応したリアルタイムインタラクティブ動画生成モデルです。ユーザーは音声指示を通じて、いつでも動画生成コンテンツを制御できます。Vidu S1は、ぼやけやドリフト、視覚的な歪みを生じることなく、無限長のリアルタイム動画生成をサポートします。TurboDiffusionとTurboServeを基盤に構築されており、一般的な消費者向けGPUで最大42 FPS、540pのリアルタイム動画出力を実現します。ユーザーは実在人物、アニメ、ペットなどのカスタム画像をアップロードし、異なる音声トーンを選択してパーソナライズされた体験を楽しめます。実験結果では、Vidu S1はすべてのテスト指標において最高のパフォーマンスを達成し、リアルタイム推論の要件を完全に満たしています。プレイ可能なオンラインデモはhttps://vidu.com/vidu-streamでご覧いただけます。
English
We introduce Vidu S1, a real-time interactive video generation model supporting voice control of digital characters. Users can control video generation content at any moment through voice instructions. Vidu S1 supports infinite-length real-time video generation without blurring, drift, or visual distortion. Built with TurboDiffusion and TurboServe, Vidu S1 outputs 540p real-time videos at up to 42 FPS on regular consumer GPUs. Users can upload custom images of real people, anime, and pets, and choose different voice tones for personalized experiences. Experiments show that Vidu S1 achieves the best performance across all test metrics while fully meeting real-time inference requirements. A playable online demo is available at https://vidu.com/vidu-stream.