ChatPaper.aiChatPaper

MACE-Dance: Especialistas em Cascata de Movimento e Aparência para Geração de Vídeos de Dança Orientados por Música

MACE-Dance: Motion-Appearance Cascaded Experts for Music-Driven Dance Video Generation

May 7, 2026
Autores: Kaixing Yang, Jiashu Zhu, Xulong Tang, Ziqiao Peng, Xiangyue Zhang, Puwei Wang, Jiahong Wu, Xiangxiang Chu, Hongyan Liu, Jun He
cs.AI

Resumo

Com o surgimento de plataformas online de vídeos de dança e os rápidos avanços em conteúdo gerado por inteligência artificial (AIGC), a geração de dança orientada por música emergiu como uma direção de pesquisa promissora. Apesar do progresso substancial em domínios relacionados, como geração de dança 3D orientada por música, animação de imagem guiada por pose e síntese de cabeça falante guiada por áudio, os métodos existentes não podem ser diretamente adaptados a essa tarefa. Além disso, os estudos limitados nessa área ainda enfrentam dificuldades em alcançar conjuntamente alta qualidade visual e movimento humano realista. Assim, apresentamos o MACE-Dance, uma estrutura de geração de vídeos de dança orientada por música com Mistura de Especialistas (MoE) em cascata. O Expert em Movimento realiza a geração de movimento 3D a partir de música, impondo plausibilidade cinemática e expressividade artística, enquanto o Expert em Aparência realiza a síntese de vídeo condicionada por movimento e referência, preservando a identidade visual com coerência espaço-temporal. Especificamente, o Expert em Movimento adota um modelo de difusão com uma arquitetura híbrida BiMamba-Transformer e uma estratégia de Treinamento Livre de Orientação (GFT), alcançando desempenho de estado da arte (SOTA) na geração de dança 3D. O Expert em Aparência emprega uma estratégia de ajuste fino estético-cinemático desacoplado, alcançando desempenho de estado da arte (SOTA) na animação de imagem guiada por pose. Para melhor avaliar essa tarefa, organizamos um conjunto de dados diverso e em larga escala e projetamos um protocolo de avaliação movimento-aparência. Com base nesse protocolo, o MACE-Dance também alcança desempenho de estado da arte. O código está disponível em https://github.com/AMAP-ML/MACE-Dance.
English
With the rise of online dance-video platforms and rapid advances in AI-generated content (AIGC), music-driven dance generation has emerged as a compelling research direction. Despite substantial progress in related domains such as music-driven 3D dance generation, pose-driven image animation, and audio-driven talking-head synthesis, existing methods cannot be directly adapted to this task. Moreover, the limited studies in this area still struggle to jointly achieve high-quality visual appearance and realistic human motion. Accordingly, we present MACE-Dance, a music-driven dance video generation framework with cascaded Mixture-of-Experts (MoE). The Motion Expert performs music-to-3D motion generation while enforcing kinematic plausibility and artistic expressiveness, whereas the Appearance Expert carries out motion- and reference-conditioned video synthesis, preserving visual identity with spatiotemporal coherence. Specifically, the Motion Expert adopts a diffusion model with a BiMamba-Transformer hybrid architecture and a Guidance-Free Training (GFT) strategy, achieving state-of-the-art (SOTA) performance in 3D dance generation. The Appearance Expert employs a decoupled kinematic-aesthetic fine-tuning strategy, achieving state-of-the-art (SOTA) performance in pose-driven image animation. To better benchmark this task, we curate a large-scale and diverse dataset and design a motion-appearance evaluation protocol. Based on this protocol, MACE-Dance also achieves state-of-the-art performance. Code is available at https://github.com/AMAP-ML/MACE-Dance.