Um Runtime Nativo Quantizado para Geração de Áudio Semântico no Dispositivo
A Quantized Native Runtime for On-Device Semantic Audio Generation
July 9, 2026
Autores: Matteo Spanio, Antonio Rodà
cs.AI
Resumo
Aplicações de áudio semântico exigem cada vez mais geração controlável em hardware commodity e embarcado, em vez de pilhas de datacenter com grande dependência de frameworks. Apresentamos o aria, um runtime nativo livre de dependências que executa o pipeline completo de texto para música do Stable Audio~3 (SA3) em GPUs comuns, máquinas apenas com CPU e um Raspberry~Pi~5, sem Python ou framework de aprendizado profundo subjacente. Nossa principal contribuição é um estudo de quantização: executar o modelo em precisão numérica reduzida para se adequar a orçamentos de memória restritos, economizando memória no lugar em vez de adicioná-la. Como o runtime possui cada tensor interno, ele também expõe a ativação por direcionamento (activation steering), uma maneira de baixo custo para direcionar o que o modelo gera. Avaliamos o custo de qualidade com três medidas independentes da saída (aderência à instrução, qualidade geral do áudio, preservação do gosto), cada uma comparada com a variação comum entre sementes aleatórias. A precisão de oito bits não mostra perda mensurável de qualidade em nenhuma medida, enquanto reduz drasticamente a memória, e é o modo mais rápido na GPU; quatro bits adiciona um custo pequeno e limitado, mas reduz o tamanho o suficiente para executar o modelo de 1,2 bilhão de parâmetros em um Pi de 8\,GB. Comparado com a implementação oficial, o aria iguala ou supera a velocidade de geração e inicia cerca de sete vezes mais rápido. Um estudo de caso da interface de direcionamento gera música que carrega associações de gosto (condimento sônico - sonic seasoning), com controle genuíno, porém limitado, para um subconjunto de atributos. Esses resultados tornam um runtime compacto e quantizado com controle embutido uma base prática para áudio semântico em dispositivos em ambientes de Internet dos Sons. O runtime aria está disponível em https://github.com/matteospanio/aria.
English
Semantic audio applications increasingly require controllable generation on commodity and embedded hardware rather than through framework-heavy datacenter stacks. We present aria, a dependency-free native runtime that runs the complete text-to-music pipeline of Stable Audio~3 (SA3) on ordinary GPUs, CPU-only machines, and a Raspberry~Pi~5, with no Python or deep-learning framework underneath. Our main contribution is a study of quantization: running the model at lower numerical precision to fit tight memory budgets, saving memory in place rather than adding to it. Because the runtime owns every internal tensor, it also exposes activation steering, a low-cost way to steer what the model generates. We judge the quality cost with three independent measures of the output (prompt adherence, overall audio quality, taste preservation), each compared against the ordinary variation between random seeds. Eight-bit precision shows no measurable quality loss on any measure while sharply cutting memory, and it is the fastest mode on the GPU; four-bit adds a small, bounded cost but shrinks the footprint enough to run the 1.2-billion-parameter model on an 8\,GB Pi. Against the official implementation, aria matches or exceeds generation speed and starts about seven times faster. A case study of the steering interface generates music carrying taste associations (sonic seasoning), with genuine but bounded control for a subset of attributes. These results make a compact, quantized runtime with built-in control a practical basis for on-device semantic audio in Internet-of-Sounds settings. The aria runtime is released at https://github.com/matteospanio/aria.