ChatPaper.aiChatPaper

Технический отчет WanSong v1.0

WanSong v1.0 Technical Report

July 16, 2026
Авторы: Binghui Chen, Pandeng Li, Yu Liu, Jingren Zhou
cs.AI

Аннотация

Модели генерации музыки на основе фундаментальных подходов в последнее время привлекают значительное внимание промышленности. Однако достижение эффективной генерации и высококачественного длительного аудио с сохранением возможности управления остаётся сложной задачей. Для удовлетворения этих потребностей мы представляем WanSong — простой, но мощный подход к генерации длительных коммерческих песен. В отличие от авторегрессивных (AR) и каскадных многоэтапных конвейеров (например, AR с последующей диффузией), WanSong представляет собой модель, основанную исключительно на диффузии, которая напрямую генерирует высококачественные многоязычные песни продолжительностью до 5 минут и выводит двойные дорожки (вокал и фоновая музыка) за один проход. Кроме того, наша диффузионная структура позволяет ускорить вывод за счёт дистилляции шагов и предлагает эффективный путь для тонкой настройки и кастомизации для поддержки последующих задач редактирования.
English
Music generation foundation models have recently attracted significant industry attention. However, achieving efficient generation and high-fidelity long-form audio while supporting controllability remains challenging. To address these needs, we present WanSong, a simple yet powerful approach for long-form, commercial-grade song generation. Unlike autoregressive (AR) and cascaded multi-stage pipelines (\eg, AR followed by diffusion), WanSong is a pure diffusion-based model that directly generates high-fidelity, multilingual songs up to 5 minutes and outputs dual stems (vocals and background music) in a single run. In addition, our diffusion framework enables faster inference through step-distillation, and offers an efficient pathway for fine-tuning and customization to support downstream editing tasks.