AVTok: Tokenização Unificada 1D para Geração Holística de Áudio-Vídeo
AVTok: 1D Unified Tokenization for Holistic Audio-Video Generation
June 29, 2026
Autores: Kien T. Pham, I Chieh Chen, Qifeng Chen, Long Chen
cs.AI
Resumo
A geração de áudio-vídeo recentemente ganhou atenção de pesquisa sem precedentes, visando sintetizar conteúdo de vídeo com som de alta qualidade, com sincronização refinada e alinhamento semântico entre os componentes auditivo e visual. Os métodos anteriores adotam predominantemente um design de dois ramos, com módulos separados de tokenização e geração por modalidade, negligenciando a lacuna de representação enquanto exigem intensivos recursos computacionais para treinamento adequado. Inspirados pelos avanços recentes em tokenização visual unidimensional, apresentamos o AVTok, um novo tokenizador unificado designado para geração holística de áudio-vídeo. O AVTok apresenta uma arquitetura baseada em transformador de fluxo duplo, com codificador-decodificador compartilhado e consultas aprendíveis específicas por modalidade, para codificar de forma eficiente e eficaz um par áudio-vídeo em uma representação latente unidimensional compacta com um codebook unificado. Para lidar com o desequilíbrio de informações heterogêneas que impede o AVTok de explorar informações audiovisuais alinhadas, concebemos uma estratégia de treinamento hierárquico para realizar progressivamente capacidades de reconstrução para cada modalidade. Experimentos extensivos demonstram que o AVTok se destaca tanto na reconstrução de áudio-vídeo quanto quando integrado em pipelines downstream para geração de áudio para vídeo, vídeo para áudio e geração conjunta de áudio-vídeo condicionada a classes. O AVTok abre caminho para o desafio da tokenização conjunta de áudio-vídeo e fornece uma direção potencial para construir grandes modelos multimodais unificados para geração de áudio-vídeo.
English
Audio-video generation has recently gained unprecedented research attention, aiming to synthesize high-quality sounding video content with fine-grained synchronization and semantic alignment between the auditory and visual components. The preceding methods predominantly adopt a dual-branch design with separate tokenization and generation modules per modality, neglecting the representation gap while necessitating intensive computational resources for proper training. Inspired by recent advancements in one-dimensional visual tokenization, we present AVTok, a novel unified tokenizer designated for holistic audio-video generation. AVTok features a dual-stream transformer-based architecture with shared encoder-decoder and modal-specific learnable queries to efficiently and effectively encode an audio-video pair into a compact one-dimensional latent representation with a unified codebook. To cope with the heterogeneous information imbalance that hinders AVTok from exploiting aligned audio-visual information, we devise a hierarchical training strategy to progressively realize reconstruction capabilities for each modality. Extensive experiments demonstrate that AVTok excels both in audio-video reconstruction and when integrated into downstream pipelines for audio-to-video, video-to-audio, and class-conditional joint audio-video generation. AVTok paves the way for the challenge of joint audio-video tokenization and provides a potential direction to build unified large multimodal models for audio-video generation.