Квантизированная нативная среда выполнения для семантической генерации аудио на устройстве
A Quantized Native Runtime for On-Device Semantic Audio Generation
July 9, 2026
Авторы: Matteo Spanio, Antonio Rodà
cs.AI
Аннотация
Семантические аудиоприложения всё чаще требуют контролируемой генерации на массовом и встраиваемом оборудовании, а не через основанные на фреймворках датацентровые стеки. Мы представляем aria — независимую среду выполнения без внешних зависимостей, которая запускает полный конвейер «текст–музыка» Stable Audio 3 (SA3) на обычных GPU, машинах без GPU и Raspberry Pi 5, не требуя ни Python, ни фреймворков глубокого обучения. Наш основной вклад — исследование квантования: работа модели с пониженной числовой точностью для соответствия ограниченному бюджету памяти, при этом экономия памяти достигается на месте, без её расширения. Поскольку среда выполнения владеет каждым внутренним тензором, она также предоставляет управление активациями — недорогой способ направлять генерируемый моделью результат. Мы оцениваем потери качества с помощью трёх независимых метрик выходных данных (соответствие промпту, общее качество аудио, сохранение вкусовых ассоциаций), каждая из которых сравнивается с обычной вариацией между случайными начальными значениями. Восьмибитная точность не показывает измеримой потери качества ни по одной метрике, при этом резко сокращает потребление памяти и оказывается самым быстрым режимом на GPU; четырёхбитная вносит небольшие, ограниченные затраты, но уменьшает занимаемый объём настолько, что модель с 1,2 миллиарда параметров запускается на 8-гигабайтном Pi. По сравнению с официальной реализацией aria соответствует или превосходит скорость генерации и запускается примерно в семь раз быстрее. Пример использования интерфейса управления генерирует музыку, несущую вкусовые ассоциации (звуковой привкус), с реальным, но ограниченным контролем над подмножеством атрибутов. Эти результаты делают компактную среду выполнения с квантованием и встроенным управлением практической основой для устройств семантического аудио в контексте «Интернета звуков». Среда выполнения aria опубликована по адресу https://github.com/matteospanio/aria.
English
Semantic audio applications increasingly require controllable generation on commodity and embedded hardware rather than through framework-heavy datacenter stacks. We present aria, a dependency-free native runtime that runs the complete text-to-music pipeline of Stable Audio~3 (SA3) on ordinary GPUs, CPU-only machines, and a Raspberry~Pi~5, with no Python or deep-learning framework underneath. Our main contribution is a study of quantization: running the model at lower numerical precision to fit tight memory budgets, saving memory in place rather than adding to it. Because the runtime owns every internal tensor, it also exposes activation steering, a low-cost way to steer what the model generates. We judge the quality cost with three independent measures of the output (prompt adherence, overall audio quality, taste preservation), each compared against the ordinary variation between random seeds. Eight-bit precision shows no measurable quality loss on any measure while sharply cutting memory, and it is the fastest mode on the GPU; four-bit adds a small, bounded cost but shrinks the footprint enough to run the 1.2-billion-parameter model on an 8\,GB Pi. Against the official implementation, aria matches or exceeds generation speed and starts about seven times faster. A case study of the steering interface generates music carrying taste associations (sonic seasoning), with genuine but bounded control for a subset of attributes. These results make a compact, quantized runtime with built-in control a practical basis for on-device semantic audio in Internet-of-Sounds settings. The aria runtime is released at https://github.com/matteospanio/aria.