Inteligência Audiovisual em Grandes Modelos de Base
Audio-Visual Intelligence in Large Foundation Models
May 5, 2026
Autores: You Qin, Kai Liu, Shengqiong Wu, Kai Wang, Shijian Deng, Yapeng Tian, Junbin Xiao, Yazhou Xing, Yinghao Ma, Bobo Li, Roger Zimmermann, Lei Cui, Furu Wei, Jiebo Luo, Hao Fei
cs.AI
Resumo
A Inteligência Audiovisual (IAV) emergiu como uma fronteira central na inteligência artificial, interligando as modalidades auditiva e visual para capacitar máquinas que podem perceber, gerar e interagir no mundo real multimodal. Na era dos grandes modelos de base, a modelagem conjunta de áudio e visão tornou-se cada vez mais crucial, não apenas para compreensão, mas também para geração controlável e raciocínio sobre sinais dinâmicos e temporalmente fundamentados. Avanços recentes, como o Meta MovieGen e o Google Veo-3, destacam o crescente foco industrial e acadêmico em arquiteturas audiovisuais unificadas que aprendem de dados multimodais massivos. No entanto, apesar do rápido progresso, a literatura permanece fragmentada, abrangendo tarefas diversas, taxonomias inconsistentes e práticas de avaliação heterogêneas que impedem a comparação sistemática e a integração de conhecimento. Esta revisão fornece a primeira análise abrangente da IAV sob a perspectiva dos grandes modelos de base. Estabelecemos uma taxonomia unificada que cobre o amplo espectro de tarefas de IAV, desde compreensão (ex.: reconhecimento de fala, localização sonora) até geração (ex.: síntese de vídeo orientada por áudio, vídeo-para-áudio) e interação (ex.: interfaces dialógicas, incorporadas ou agentivas). Sintetizamos fundamentos metodológicos, incluindo tokenização de modalidades, fusão cross-modal, geração baseada em modelos autoregressivos e de difusão, pré-treinamento em larga escala, alinhamento por instrução e otimização de preferências. Adicionalmente, compilamos conjuntos de dados representativos, benchmarks e métricas de avaliação, oferecendo uma comparação estruturada entre famílias de tarefas e identificando desafios em aberto em sincronização, raciocínio espacial, controlabilidade e segurança. Ao consolidar este campo em rápida expansão num quadro coerente, esta revisão visa servir como referência fundamental para pesquisas futuras sobre IAV em grande escala.
English
Audio-Visual Intelligence (AVI) has emerged as a central frontier in artificial intelligence, bridging auditory and visual modalities to enable machines that can perceive, generate, and interact in the multimodal real world. In the era of large foundation models, joint modeling of audio and vision has become increasingly crucial, i.e., not only for understanding but also for controllable generation and reasoning across dynamic, temporally grounded signals. Recent advances, such as Meta MovieGen and Google Veo-3, highlight the growing industrial and academic focus on unified audio-vision architectures that learn from massive multimodal data. However, despite rapid progress, the literature remains fragmented, spanning diverse tasks, inconsistent taxonomies, and heterogeneous evaluation practices that impede systematic comparison and knowledge integration. This survey provides the first comprehensive review of AVI through the lens of large foundation models. We establish a unified taxonomy covering the broad landscape of AVI tasks, ranging from understanding (e.g., speech recognition, sound localization) to generation (e.g., audio-driven video synthesis, video-to-audio) and interaction (e.g., dialogue, embodied, or agentic interfaces). We synthesize methodological foundations, including modality tokenization, cross-modal fusion, autoregressive and diffusion-based generation, large-scale pretraining, instruction alignment, and preference optimization. Furthermore, we curate representative datasets, benchmarks, and evaluation metrics, offering a structured comparison across task families and identifying open challenges in synchronization, spatial reasoning, controllability, and safety. By consolidating this rapidly expanding field into a coherent framework, this survey aims to serve as a foundational reference for future research on large-scale AVI.