ChatPaper.aiChatPaper

WanSong v1.0 技術報告書

WanSong v1.0 Technical Report

July 16, 2026
著者: Binghui Chen, Pandeng Li, Yu Liu, Jingren Zhou
cs.AI

要旨

音楽生成基盤モデルは近年、業界から大きな注目を集めている。しかし、効率的な生成と高忠実度の長時間音声を実現しつつ、制御可能性をサポートすることは依然として課題である。これらのニーズに応えるため、我々はWanSongを提案する。これは、長時間かつ商用グレードの楽曲生成のためのシンプルかつ強力なアプローチである。自己回帰(AR)モデルやカスケード型マルチステージパイプライン(例:ARに続いて拡散モデル)とは異なり、WanSongは純粋な拡散ベースモデルであり、最大5分間の高忠実度で多言語の楽曲を直接生成し、1回の実行でデュアルステム(ボーカルとバックグラウンドミュージック)を出力する。さらに、我々の拡散フレームワークは、ステップ蒸留による高速な推論を可能にし、下流の編集タスクをサポートするためのファインチューニングやカスタマイズへの効率的な経路を提供する。
English
Music generation foundation models have recently attracted significant industry attention. However, achieving efficient generation and high-fidelity long-form audio while supporting controllability remains challenging. To address these needs, we present WanSong, a simple yet powerful approach for long-form, commercial-grade song generation. Unlike autoregressive (AR) and cascaded multi-stage pipelines (\eg, AR followed by diffusion), WanSong is a pure diffusion-based model that directly generates high-fidelity, multilingual songs up to 5 minutes and outputs dual stems (vocals and background music) in a single run. In addition, our diffusion framework enables faster inference through step-distillation, and offers an efficient pathway for fine-tuning and customization to support downstream editing tasks.