WanSong v1.0 Informe Técnico
WanSong v1.0 Technical Report
July 16, 2026
Autores: Binghui Chen, Pandeng Li, Yu Liu, Jingren Zhou
cs.AI
Resumen
Los modelos fundacionales de generación musical han atraído recientemente una atención significativa por parte de la industria. Sin embargo, lograr una generación eficiente y audio de larga duración con alta fidelidad, al tiempo que se mantiene la capacidad de control, sigue siendo un desafío. Para abordar estas necesidades, presentamos WanSong, un enfoque simple pero potente para la generación de canciones de larga duración y calidad comercial. A diferencia de los pipelines autorregresivos (AR) y en cascada de múltiples etapas (p. ej., AR seguido de difusión), WanSong es un modelo puramente basado en difusión que genera directamente canciones multilingües de alta fidelidad de hasta 5 minutos y produce dos pistas independientes (voces y música de fondo) en una sola ejecución. Además, nuestro marco de difusión permite una inferencia más rápida mediante destilación de pasos y ofrece una vía eficiente para el ajuste fino y la personalización, lo que facilita tareas de edición posteriores.
English
Music generation foundation models have recently attracted significant industry attention. However, achieving efficient generation and high-fidelity long-form audio while supporting controllability remains challenging. To address these needs, we present WanSong, a simple yet powerful approach for long-form, commercial-grade song generation. Unlike autoregressive (AR) and cascaded multi-stage pipelines (\eg, AR followed by diffusion), WanSong is a pure diffusion-based model that directly generates high-fidelity, multilingual songs up to 5 minutes and outputs dual stems (vocals and background music) in a single run. In addition, our diffusion framework enables faster inference through step-distillation, and offers an efficient pathway for fine-tuning and customization to support downstream editing tasks.