WanSong v1.0 기술 보고서
WanSong v1.0 Technical Report
July 16, 2026
저자: Binghui Chen, Pandeng Li, Yu Liu, Jingren Zhou
cs.AI
초록
최근 음악 생성 기반 모델이 업계의 큰 주목을 받고 있다. 그러나 효율적인 생성과 고충실도의 장시간 오디오 구현을 지원하는 동시에 제어 가능성을 확보하는 것은 여전히 어려운 과제로 남아 있다. 이러한 요구를 해결하기 위해, 우리는 장시간 상업용 노래 생성을 위한 간단하면서도 강력한 접근 방식인 WanSong을 제안한다. 자기회귀 및 계단식 다단계 파이프라인(예: 자기회귀 후 확산 모델)과 달리, WanSong은 순수 확산 기반 모델로, 최대 5분 길이의 고충실도 다국어 노래를 직접 생성하고 단일 실행으로 듀얼 트랙(보컬 및 배경 음악)을 출력한다. 또한, 우리의 확산 프레임워크는 단계 증류를 통해 더 빠른 추론을 가능하게 하며, 하위 편집 작업을 지원하기 위한 미세 조정 및 커스터마이징의 효율적인 경로를 제공한다.
English
Music generation foundation models have recently attracted significant industry attention. However, achieving efficient generation and high-fidelity long-form audio while supporting controllability remains challenging. To address these needs, we present WanSong, a simple yet powerful approach for long-form, commercial-grade song generation. Unlike autoregressive (AR) and cascaded multi-stage pipelines (\eg, AR followed by diffusion), WanSong is a pure diffusion-based model that directly generates high-fidelity, multilingual songs up to 5 minutes and outputs dual stems (vocals and background music) in a single run. In addition, our diffusion framework enables faster inference through step-distillation, and offers an efficient pathway for fine-tuning and customization to support downstream editing tasks.