WanSong v1.0 Technisch Rapport
WanSong v1.0 Technical Report
July 16, 2026
Auteurs: Binghui Chen, Pandeng Li, Yu Liu, Jingren Zhou
cs.AI
Samenvatting
Muziekgeneratie-funderingsmodellen hebben recentelijk aanzienlijke industriële aandacht getrokken. Het realiseren van efficiënte generatie en hoogwaardige langdurige audio met ondersteuning van beheersbaarheid blijft echter uitdagend. Om aan deze behoeften te voldoen, presenteren we WanSong, een eenvoudige maar krachtige aanpak voor het genereren van langdurige, commerciële liedjes. In tegenstelling tot autoregressieve (AR) en trapsgewijze meerfasige pipelines (bijv. AR gevolgd door diffusie), is WanSong een zuiver diffusiegebaseerd model dat direct hoogwaardige, meertalige liedjes tot 5 minuten genereert en in één enkele uitvoering tweeledige stems (zang en achtergrondmuziek) produceert. Bovendien maakt ons diffusieframework snellere inferentie mogelijk door stapdestillatie en biedt het een efficiënt pad voor fine-tuning en maatwerk ter ondersteuning van stroomafwaartse bewerkingstaken.
English
Music generation foundation models have recently attracted significant industry attention. However, achieving efficient generation and high-fidelity long-form audio while supporting controllability remains challenging. To address these needs, we present WanSong, a simple yet powerful approach for long-form, commercial-grade song generation. Unlike autoregressive (AR) and cascaded multi-stage pipelines (\eg, AR followed by diffusion), WanSong is a pure diffusion-based model that directly generates high-fidelity, multilingual songs up to 5 minutes and outputs dual stems (vocals and background music) in a single run. In addition, our diffusion framework enables faster inference through step-distillation, and offers an efficient pathway for fine-tuning and customization to support downstream editing tasks.