ChatPaper.aiChatPaper

Rapport technique de WanSong v1.0

WanSong v1.0 Technical Report

July 16, 2026
Auteurs: Binghui Chen, Pandeng Li, Yu Liu, Jingren Zhou
cs.AI

Résumé

Les modèles fondamentaux de génération musicale ont récemment suscité un intérêt considérable dans l'industrie. Cependant, obtenir une génération efficace et un audio longue durée de haute fidélité tout en garantissant la contrôlabilité reste un défi. Pour répondre à ces besoins, nous présentons WanSong, une approche simple mais puissante pour la génération de chansons longues de qualité commerciale. Contrairement aux pipelines autorégressifs (AR) et aux pipelines en cascade multi-étapes (par exemple, AR suivi de diffusion), WanSong est un modèle purement basé sur la diffusion qui génère directement des chansons multilingues de haute fidélité pouvant aller jusqu'à 5 minutes et produit deux pistes (voix et musique de fond) en une seule exécution. De plus, notre cadre de diffusion permet une inférence plus rapide grâce à la distillation par étapes et offre une voie efficace pour le réglage fin et la personnalisation afin de prendre en charge des tâches d'édition en aval.
English
Music generation foundation models have recently attracted significant industry attention. However, achieving efficient generation and high-fidelity long-form audio while supporting controllability remains challenging. To address these needs, we present WanSong, a simple yet powerful approach for long-form, commercial-grade song generation. Unlike autoregressive (AR) and cascaded multi-stage pipelines (\eg, AR followed by diffusion), WanSong is a pure diffusion-based model that directly generates high-fidelity, multilingual songs up to 5 minutes and outputs dual stems (vocals and background music) in a single run. In addition, our diffusion framework enables faster inference through step-distillation, and offers an efficient pathway for fine-tuning and customization to support downstream editing tasks.