Audio Flamingo: Un Nuovo Modello Linguistico Audio con Capacità di Apprendimento Few-Shot e Dialogo

Abstract

Aumentare la capacità dei grandi modelli linguistici (LLM) di comprendere l'audio — inclusi suoni non vocali e aspetti non verbali del parlato — è di fondamentale importanza per applicazioni reali e diversificate degli LLM. In questo articolo, proponiamo Audio Flamingo, un innovativo modello linguistico audio che possiede: 1) forti capacità di comprensione dell'audio, 2) la capacità di adattarsi rapidamente a compiti non visti tramite apprendimento in contesto e recupero, e 3) solide abilità di dialogo multi-turn. Introduciamo una serie di tecniche di addestramento, progettazione architetturale e strategie sui dati per dotare il nostro modello di queste capacità. Valutazioni estensive su vari compiti di comprensione dell'audio confermano l'efficacia del nostro metodo, stabilendo nuovi benchmark all'avanguardia.

English

Augmenting large language models (LLMs) to understand audio -- including non-speech sounds and non-verbal speech -- is critically important for diverse real-world applications of LLMs. In this paper, we propose Audio Flamingo, a novel audio language model with 1) strong audio understanding abilities, 2) the ability to quickly adapt to unseen tasks via in-context learning and retrieval, and 3) strong multi-turn dialogue abilities. We introduce a series of training techniques, architecture design, and data strategies to enhance our model with these abilities. Extensive evaluations across various audio understanding tasks confirm the efficacy of our method, setting new state-of-the-art benchmarks.

Audio Flamingo: Un Nuovo Modello Linguistico Audio con Capacità di Apprendimento Few-Shot e Dialogo

Audio Flamingo: A Novel Audio Language Model with Few-Shot Learning and Dialogue Abilities

Abstract

Support