AVTok: Eendimensionale Uniforme Tokenisatie voor Holistische Audio-Video Generatie
AVTok: 1D Unified Tokenization for Holistic Audio-Video Generation
June 29, 2026
Auteurs: Kien T. Pham, I Chieh Chen, Qifeng Chen, Long Chen
cs.AI
Samenvatting
Audio-videogeneratie heeft recentelijk ongekende onderzoeksaandacht gekregen, met als doel hoogwaardige klinkende video-inhoud te synthetiseren met fijnmazige synchronisatie en semantische afstemming tussen de auditieve en visuele componenten. De voorgaande methoden hanteren voornamelijk een dubbele takontwerp met afzonderlijke tokenisatie- en generatiemodules per modaliteit, waarbij de representatiekloof wordt verwaarloosd en intensieve computationele middelen vereist zijn voor een goede training. Geïnspireerd door recente vooruitgang in eendimensionale visuele tokenisatie presenteren we AVTok, een nieuwe uniforme tokenizer ontworpen voor holistische audio-videogeneratie. AVTok heeft een duale stroom transformatorarchitectuur met gedeelde encoder-decoder en modale-specifieke leerbare queries om een audio-videopaar efficiënt en effectief te coderen in een compacte eendimensionale latente representatie met een uniform codeboek. Om de heterogene informatieonevenwichtigheid aan te pakken die AVTok belemmert om afgestemde audio-visuele informatie te benutten, ontwikkelen we een hiërarchische trainingsstrategie om geleidelijk reconstructiecapaciteiten voor elke modaliteit te realiseren. Uitgebreide experimenten tonen aan dat AVTok uitblinkt in zowel audio-videoreconstructie als wanneer geïntegreerd in downstream-pijplijnen voor audio-naar-video, video-naar-audio en klasseconditionele gezamenlijke audio-videogeneratie. AVTok baant de weg voor de uitdaging van gezamenlijke audio-videotokenisatie en biedt een mogelijke richting voor het bouwen van uniforme grote multimodale modellen voor audio-videogeneratie.
English
Audio-video generation has recently gained unprecedented research attention, aiming to synthesize high-quality sounding video content with fine-grained synchronization and semantic alignment between the auditory and visual components. The preceding methods predominantly adopt a dual-branch design with separate tokenization and generation modules per modality, neglecting the representation gap while necessitating intensive computational resources for proper training. Inspired by recent advancements in one-dimensional visual tokenization, we present AVTok, a novel unified tokenizer designated for holistic audio-video generation. AVTok features a dual-stream transformer-based architecture with shared encoder-decoder and modal-specific learnable queries to efficiently and effectively encode an audio-video pair into a compact one-dimensional latent representation with a unified codebook. To cope with the heterogeneous information imbalance that hinders AVTok from exploiting aligned audio-visual information, we devise a hierarchical training strategy to progressively realize reconstruction capabilities for each modality. Extensive experiments demonstrate that AVTok excels both in audio-video reconstruction and when integrated into downstream pipelines for audio-to-video, video-to-audio, and class-conditional joint audio-video generation. AVTok paves the way for the challenge of joint audio-video tokenization and provides a potential direction to build unified large multimodal models for audio-video generation.