WanSong v1.0 技術報告
WanSong v1.0 Technical Report
July 16, 2026
作者: Binghui Chen, Pandeng Li, Yu Liu, Jingren Zhou
cs.AI
摘要
音樂生成基礎模型近期引起了業界的廣泛關注。然而,如何在支援可控性的同時,實現高效率生成與高保真長音頻仍是一大挑戰。為滿足這些需求,我們提出 WanSong——一個簡單而強大的方案,用於生成商用級別的長格式歌曲。與自回歸(AR)及級聯多階段流程(例如先執行 AR 再進行擴散)不同,WanSong 是一個純粹基於擴散的模型,能夠直接生成長達 5 分鐘的高保真多語言歌曲,並在一次執行中輸出雙音軌(人聲與背景音樂)。此外,我們的擴散框架透過步驟蒸餾實現更快的推論速度,並提供高效率的微調與定制途徑,以支援下游編輯任務。
English
Music generation foundation models have recently attracted significant industry attention. However, achieving efficient generation and high-fidelity long-form audio while supporting controllability remains challenging. To address these needs, we present WanSong, a simple yet powerful approach for long-form, commercial-grade song generation. Unlike autoregressive (AR) and cascaded multi-stage pipelines (\eg, AR followed by diffusion), WanSong is a pure diffusion-based model that directly generates high-fidelity, multilingual songs up to 5 minutes and outputs dual stems (vocals and background music) in a single run. In addition, our diffusion framework enables faster inference through step-distillation, and offers an efficient pathway for fine-tuning and customization to support downstream editing tasks.