ChatPaper.aiChatPaper

Talker-T2AV: Geração Conjunta de Áudio e Vídeo com Fala por meio de Modelagem Autorregressiva de Difusão

Talker-T2AV: Joint Talking Audio-Video Generation with Autoregressive Diffusion Modeling

April 26, 2026
Autores: Zhen Ye, Xu Tan, Aoxiong Yin, Hongzhan Lin, Guangyan Zhang, Peiwen Sun, Yiming Li, Chi-Min Chan, Wei Ye, Shikun Zhang, Wei Xue
cs.AI

Resumo

Modelos de geração conjunta de áudio e vídeo demonstraram que a geração unificada produz uma coerência cross-modal superior às abordagens em cascata. No entanto, os modelos existentes acoplam as modalidades durante todo o processo de remoção de ruído por meio de atenção generalizada, tratando a semântica de alto nível e os detalhes de baixo nível de uma forma totalmente entrelaçada. Isto é subótimo para a síntese de cabeças falantes: embora o áudio e o movimento facial estejam semanticamente correlacionados, as suas realizações de baixo nível (sinais acústicos e texturas visuais) seguem processos de renderização distintos. Impor uma modelagem conjunta em todos os níveis causa um entrelaçamento desnecessário e reduz a eficiência. Propomos o Talker-T2AV, uma framework de difusão autoregressiva na qual a modelagem cross-modal de alto nível ocorre numa estrutura compartilhada (backbone), enquanto o refinamento de baixo nível utiliza decodificadores específicos por modalidade. Um modelo de linguagem autoregressivo compartilhado processa conjuntamente o áudio e o vídeo num espaço unificado de tokens ao nível de *patches*. Duas cabeças leves de transformador de difusão decodificam os estados ocultos em latentes de áudio e vídeo ao nível do *frame*. Experiências em benchmarks de retratos falantes mostram que o Talker-T2AV supera as linhas de base de ramo duplo em precisão de sincronização labial, qualidade de vídeo e qualidade de áudio, alcançando uma consistência cross-modal mais forte do que os *pipelines* em cascata.
English
Joint audio-video generation models have shown that unified generation yields stronger cross-modal coherence than cascaded approaches. However, existing models couple modalities throughout denoising via pervasive attention, treating high-level semantics and low-level details in a fully entangled manner. This is suboptimal for talking head synthesis: while audio and facial motion are semantically correlated, their low-level realizations (acoustic signals and visual textures) follow distinct rendering processes. Enforcing joint modeling across all levels causes unnecessary entanglement and reduces efficiency. We propose Talker-T2AV, an autoregressive diffusion framework where high-level cross-modal modeling occurs in a shared backbone, while low-level refinement uses modality-specific decoders. A shared autoregressive language model jointly reasons over audio and video in a unified patch-level token space. Two lightweight diffusion transformer heads decode the hidden states into frame-level audio and video latents. Experiments on talking portrait benchmarks show Talker-T2AV outperforms dual-branch baselines in lip-sync accuracy, video quality, and audio quality, achieving stronger cross-modal consistency than cascaded pipelines.