ChatPaper.aiChatPaper

Un environnement d'exécution natif quantifié pour la génération audio sémantique embarquée

A Quantized Native Runtime for On-Device Semantic Audio Generation

July 9, 2026
Auteurs: Matteo Spanio, Antonio Rodà
cs.AI

Résumé

Les applications audio sémantiques exigent de plus en plus une génération contrôlable sur du matériel grand public et embarqué, plutôt que via des piles de centres de données lourdes en frameworks. Nous présentons aria, un exécutable natif sans dépendances qui exécute l'intégralité de la chaîne texte-musique de Stable Audio~3 (SA3) sur des GPU ordinaires, des machines sans GPU, et un Raspberry~Pi~5, sans Python ni framework d'apprentissage profond en dessous. Notre contribution principale est une étude de la quantification : exécuter le modèle à une précision numérique réduite pour s'adapter à des budgets mémoire serrés, en économisant de la mémoire sur place plutôt qu'en l'ajoutant. Comme l'exécutable possède chaque tenseur interne, il expose également le guidage d'activation, une méthode peu coûteuse pour orienter ce que le modèle génère. Nous évaluons le coût en qualité à l'aide de trois mesures indépendantes de la sortie (respect de la consigne, qualité audio globale, préservation du goût), chacune comparée à la variation ordinaire entre les germes aléatoires. La précision sur huit bits ne montre aucune perte de qualité mesurable sur aucune mesure tout en réduisant nettement la mémoire, et constitue le mode le plus rapide sur GPU ; la précision sur quatre bits ajoute un coût faible et borné mais réduit l'empreinte mémoire suffisamment pour exécuter le modèle de 1,2 milliard de paramètres sur un Pi de 8~Go. Par rapport à l'implémentation officielle, aria atteint ou dépasse la vitesse de génération et démarre environ sept fois plus vite. Une étude de cas de l'interface de guidage génère de la musique porteuse d'associations de goût (assaisonnement sonique), avec un contrôle réel mais borné sur un sous-ensemble d'attributs. Ces résultats font d'un exécutable quantifié compact avec contrôle intégré une base pratique pour l'audio sémantique sur appareil dans des contextes Internet des Sons. L'exécutable aria est publié à l'adresse https://github.com/matteospanio/aria.
English
Semantic audio applications increasingly require controllable generation on commodity and embedded hardware rather than through framework-heavy datacenter stacks. We present aria, a dependency-free native runtime that runs the complete text-to-music pipeline of Stable Audio~3 (SA3) on ordinary GPUs, CPU-only machines, and a Raspberry~Pi~5, with no Python or deep-learning framework underneath. Our main contribution is a study of quantization: running the model at lower numerical precision to fit tight memory budgets, saving memory in place rather than adding to it. Because the runtime owns every internal tensor, it also exposes activation steering, a low-cost way to steer what the model generates. We judge the quality cost with three independent measures of the output (prompt adherence, overall audio quality, taste preservation), each compared against the ordinary variation between random seeds. Eight-bit precision shows no measurable quality loss on any measure while sharply cutting memory, and it is the fastest mode on the GPU; four-bit adds a small, bounded cost but shrinks the footprint enough to run the 1.2-billion-parameter model on an 8\,GB Pi. Against the official implementation, aria matches or exceeds generation speed and starts about seven times faster. A case study of the steering interface generates music carrying taste associations (sonic seasoning), with genuine but bounded control for a subset of attributes. These results make a compact, quantized runtime with built-in control a practical basis for on-device semantic audio in Internet-of-Sounds settings. The aria runtime is released at https://github.com/matteospanio/aria.