ChatPaper.aiChatPaper

Un Tiempo de Ejecución Nativo Cuantizado para la Generación de Audio Semántico en Dispositivo

A Quantized Native Runtime for On-Device Semantic Audio Generation

July 9, 2026
Autores: Matteo Spanio, Antonio Rodà
cs.AI

Resumen

Las aplicaciones de audio semántico requieren cada vez más una generación controlable en hardware comercial y embebido, en lugar de depender de pilas de centros de datos con muchos frameworks. Presentamos aria, un runtime nativo sin dependencias que ejecuta el pipeline completo de texto a música de Stable Audio~3 (SA3) en GPUs comunes, máquinas exclusivamente con CPU y una Raspberry~Pi~5, sin Python ni un framework de aprendizaje profundo subyacente. Nuestra contribución principal es un estudio de cuantización: ejecutar el modelo con precisión numérica reducida para ajustarse a presupuestos de memoria ajustados, ahorrando memoria en lugar de aumentarla. Dado que el runtime posee cada tensor interno, también expone el control de activaciones, una forma de bajo costo para dirigir lo que genera el modelo. Evaluamos el coste en calidad mediante tres medidas independientes de la salida (adherencia a la instrucción, calidad general del audio, preservación del gusto), cada una comparada con la variación habitual entre semillas aleatorias. La precisión de ocho bits no muestra una pérdida de calidad medible en ninguna medida, a la vez que reduce drásticamente la memoria, y es el modo más rápido en la GPU; la de cuatro bits añade un coste pequeño y acotado, pero reduce la huella lo suficiente como para ejecutar el modelo de 1.200 millones de parámetros en una Pi de 8\,GB. Frente a la implementación oficial, aria iguala o supera la velocidad de generación y se inicia aproximadamente siete veces más rápido. Un estudio de caso de la interfaz de control genera música que evoca asociaciones gustativas (sazonado sónico), con un control genuino pero acotado sobre un subconjunto de atributos. Estos resultados convierten un runtime compacto y cuantizado con control integrado en una base práctica para audio semántico en dispositivos en entornos de Internet de los Sonidos. El runtime aria se publica en https://github.com/matteospanio/aria.
English
Semantic audio applications increasingly require controllable generation on commodity and embedded hardware rather than through framework-heavy datacenter stacks. We present aria, a dependency-free native runtime that runs the complete text-to-music pipeline of Stable Audio~3 (SA3) on ordinary GPUs, CPU-only machines, and a Raspberry~Pi~5, with no Python or deep-learning framework underneath. Our main contribution is a study of quantization: running the model at lower numerical precision to fit tight memory budgets, saving memory in place rather than adding to it. Because the runtime owns every internal tensor, it also exposes activation steering, a low-cost way to steer what the model generates. We judge the quality cost with three independent measures of the output (prompt adherence, overall audio quality, taste preservation), each compared against the ordinary variation between random seeds. Eight-bit precision shows no measurable quality loss on any measure while sharply cutting memory, and it is the fastest mode on the GPU; four-bit adds a small, bounded cost but shrinks the footprint enough to run the 1.2-billion-parameter model on an 8\,GB Pi. Against the official implementation, aria matches or exceeds generation speed and starts about seven times faster. A case study of the steering interface generates music carrying taste associations (sonic seasoning), with genuine but bounded control for a subset of attributes. These results make a compact, quantized runtime with built-in control a practical basis for on-device semantic audio in Internet-of-Sounds settings. The aria runtime is released at https://github.com/matteospanio/aria.