Ежедневно отобранные исследовательские статьи по ИИ с переводами
Мы представляем Vidu S1 — модель интерактивной генерации видео в реальном времени с голосовым управлением цифровыми персонажами. Пользователи могут в любой момент управлять содержимым генерации с помощью голосовых команд. Vidu S1 поддерживает генерацию видео в реальном времени неограниченной длины без размытия, дрейфа или визуальных искажений. Построенный на основе TurboDiffusion и TurboServe, Vidu S1 выводит видео с разрешением 540p в реальном времени с частотой до 42 FPS на обычных потребительских GPU. Пользователи могут загружать собственные изображения реальных людей, аниме-персонажей и домашних животных, а также выбирать различные тембры голоса для персонализированного взаимодействия. Эксперименты показывают, что Vidu S1 достигает наилучших результатов по всем тестовым метрикам, полностью удовлетворяя требованиям к выводу в реальном времени. Интерактивная онлайн-демонстрация доступна по адресу https://vidu.com/vidu-stream.
Внутренняя сложность понимания видео затрудняет определение того, обусловлена ли производительность бенчмарков Video-LLM зрительным восприятием, лингвистическими рассуждениями или априорными знаниями. Хотя появилось множество бенчмарков для оценки высокоуровневых рассуждений, общие критерии оценки понимания видео по-прежнему остаются без должного внимания. Вместо того чтобы вводить очередной бенчмарк, мы делаем шаг назад и пересматриваем критерии оценки понимания видео. В данной работе мы представляем Video-Oasis — устойчивый диагностический набор для систематического аудита существующих бенчмарков понимания видео. Этот аудит показывает, что 55% образцов существующих бенчмарков можно решить без визуального ввода или временного контекста. После фильтрации этих «коротких путей» оставшиеся задачи, требующие собственно видео-анализа, выявляют существенный разрыв в возможностях: современные модели показывают результаты лишь незначительно выше случайного угадывания. Основываясь на этих выводах, мы используем выделенные задачи как экспериментальную площадку для исследования того, какие алгоритмические проектные решения способствуют надежному пониманию видео. Мы надеемся, что наша работа послужит практической основой для построения строгих бенчмарков видео и оценки будущих Video-LLM. Код доступен по адресу: https://github.com/sejong-rcv/Video-Oasis.
Распознавание композиционных действий в условиях нулевого обучения (ZS-CAR) требует распознавания новых комбинаций глагол-объект, составленных из ранее наблюдаемых примитивов. В данной работе мы рассматриваем ключевую проблему: модели предсказывают глаголы с помощью объектно-ориентированных сокращений (т.е. полагаясь на класс помеченного объекта), а не на временные свидетельства. Мы утверждаем, что разреженное композиционное обучение и асимметрия в обучении глаголов и объектов могут способствовать изучению объектно-ориентированных сокращений. Наш анализ с помощью предложенных диагностических метрик показывает, что существующие методы переобучаются на паттерны совместной встречаемости в обучающем наборе и недостаточно используют временные признаки глаголов, что приводит к слабой обобщаемости на невидимые композиции. Для устранения объектно-ориентированных сокращений мы предлагаем Robust COmpositional REpresentations (RCORE) с двумя компонентами. Регуляризация априорной совместной встречаемости (CPR) добавляет явное обучение для невидимых композиций и регуляризует модель против частых априорных совместных встречаемостей, рассматривая их как сложные отрицательные примеры. Регуляризация временного порядка для композиций (TORC) обеспечивает чувствительность к временному порядку для изучения временно обоснованных представлений глаголов. На наборах данных Sth-com и EK100-com RCORE снижает диагностику сокращений и, следовательно, улучшает композиционную обобщаемость.
Бурное развитие больших языковых моделей и мультимодальных больших языковых моделей ускорило появление проактивных агентов, способных работать с повседневными инструментами и помогать пользователям в условиях реального мира. Однако существующие эталоны с трудом справляются с эффективной оценкой таких агентов, поскольку они часто полагаются на изолированные среды и парадигмы однократной оценки. Более того, их сценарные таксономии задач смешивают несколько возможностей модели в одной категории задач, что затрудняет выявление первопричин сбоев агентов. Для устранения этих ограничений мы представляем UniClawBench — первый эталон, основанный на оценке способностей и предназначенный для тестирования проактивных агентов в динамичных условиях реального мира. UniClawBench построен вокруг пяти фундаментальных способностей модели: использование навыков, исследование, рассуждение в длинном контексте, мультимодальное понимание и межплатформенная координация. На основе этих способностей мы разработали 400 двуязычных задач реального мира. В отличие от предыдущих эталонов, использующих статические, заранее записанные ответы, наш эталон оценивает агентов в живых Docker-контейнерах с помощью детализированных пошаговых контрольных точек завершения. Кроме того, мы разработали стратегию оценки с замкнутым циклом, включающую агента-исполнителя, скрытого агента-наблюдателя и агента-пользователя, для имитации реалистичной многошаговой обратной связи от человека без утечки критериев оценки. Чтобы разделить возможности базовых моделей и архитектурные решения на уровне фреймворка, мы оцениваем современные модели в рамках нескольких агентных фреймворков. Благодаря всестороннему сравнению как моделей, так и фреймворков, мы показываем, как возможности базовой модели и дизайн агентного фреймворка совместно формируют производительность в условиях реального мира. Для содействия будущим исследованиям мы делаем наш эталон и код общедоступными по адресу https://github.com/HKU-MMLab/UniClawBench.
Научные идеи редко возникают на пустом месте. Они наследуют механизмы, исправляют известные ограничения и перекомбинируют фрагменты предыдущих работ, во многом подобно биологическим геномам. Современные бенчмарки по-прежнему мало говорят о том, способны ли системы ИИ следовать этой структуре наследования. Мы представляем IdeaGene-Bench (IG-Bench) — бенчмарк для рассуждения о научной родословной и генерации идей, обусловленной этой родословной. IG-Bench построен на основе фреймворка IdeaGene: каждая статья или предложение представлены в виде набора минимальных, типизированных, обоснованных доказательствами объектов «Геном идей» (Idea Genome), а GenomeDiff выравнивает эти объекты для фиксации наследования, мутации, утраты, внешнего заимствования и нового введения в рамках шести операциональных эволюционных динамик. Бенчмарк содержит 1961 эталонный след родословной, 1085 отобранных объектов «Геном идей» и 920 парных записей GenomeDiff в 10 научных областях. Он поддерживает два вида оценки. IG-Exam (42 типа задач, 1029 экземпляров) проверяет рассуждение о родословной в закрытой форме, включая абстрагирование генома идей, отслеживание наследования, эволюционное рассуждение и верификацию родословной. IG-Arena оценивает генерацию с помощью обусловленной родословной оценки популяционно-эволюционного развития (Population-Evolution Score, PES): проверяется, может ли предложение быть встроено как связный потомок заданной популяции родословной — оно должно наследовать правильные объекты «Геном идей», содержательно отличаться от близких работ и обладать селекционной ценностью для будущих исследований. Эксперименты на 14 LLM-учёных выявили композиционное узкое место. Самая сильная система достигает лишь 27,3% точного совпадения в рассуждении о родословной, а структурированный контекст родословной перетасовывает рейтинг систем, а не помогает всем участникам одинаково.
Восстановление высококачественного видео из разреженных потоков событий является сложной задачей. Регрессионные методы часто размывают текстуры, а существующие генеративные модели страдают от проблем с долговременной стабильностью. Мы предлагаем LongE2V — новый подход, который использует предварительно обученные диффузионные приоры для видео для совместного решения задач реконструкции, предсказания и интерполяции кадров на основе событий. Путем тонкой настройки фундаментальной видео-модели наш подход достигает высокой эффективности использования данных и превосходного перцептивного качества. Мы вводим авторегрессионное развертывание и адаптивное переключение контекста для ослабления временного дрейфа в очень длинных последовательностях. Также предлагается выравнивание с перекодированием и коррекцией перекрестных остатков для обеспечения точной двунаправленной согласованности при интерполяции кадров. Кроме того, аугментация плотности вокселей событий обеспечивает устойчивость к различному разрешению сенсоров. Обширные эксперименты на реальных эталонных наборах данных показывают, что LongE2V превосходит современные методы по всем трем задачам, демонстрируя исключительную временную согласованность и обобщение без обучения. Страница проекта: https://cdfan0627.github.io/LongE2V-page/
В данной работе мы представляем Canvas360 — двухэтапную структуру для генерации панорам в контексте, объединяющую предварительное обучение с учетом геометрии и последующую тонкую настройку под конкретные задачи. Для решения проблемы отсутствия крупномасштабных высококачественных обучающих данных, адаптированных для задач генерации панорам в контексте, мы предлагаем Canvas360Dataset — коллекцию из 1 миллиона высококачественных парных панорамных образцов для переноса стиля, инпейнтинга, аутпейнтинга и редактирования, обеспечивающую эффективное обучение в различных сценариях контекстной генерации. Со стороны моделирования Canvas360 улучшает генерацию текста в панораму за счет параллельной генерации глубины, циклического дополнения на основе скорости и регуляризации с использованием функции потерь подобия, что позволяет модели изучать представления с учетом геометрии, фиксировать детали искажения объектов, а также повышать геометрическую согласованность и глобальную когерентность. Кроме того, опираясь на сильные панорамные априорные знания, Canvas360 реализует унифицированную структуру генерации панорам в контексте, поддерживающую различные последующие задачи посредством конкатенации на уровне токенов, превосходя предыдущие методы как по охвату задач, так и по гибкости моделирования. Обширные эксперименты показывают, что Canvas360 повышает достоверность панорамных изображений, демонстрируя особенно высокую производительность по специфичной для панорам метрике FAED, а также конкурентоспособные или ведущие результаты в рамках представленных количественных оценок. Дополнительную информацию можно найти на странице нашего проекта: https://zry000.github.io/Canvas360/
Современные вычислительные подходы к дизайну лекарств обычно ориентированы на генерацию молекул, обусловленную конкретными мишенями или общими молекулярными свойствами, зачастую игнорируя влияние контекста заболевания на поведение мишени и терапевтические результаты. Для устранения этого пробела мы представляем DrugGen-2 — новую генеративную модель, которая разрабатывает малые молекулы с учетом как онтологии заболеваний, так и последовательностей белков-мишеней. DrugGen-2 была создана путем точной настройки предварительно обученной модели GPT-2 на курируемом наборе данных одобренных препаратов, связанных с их заболеваниями и мишенями, с использованием двухэтапной стратегии: контролируемой точной настройки с последующим обучением с подкреплением через групповую относительную оптимизацию политики (GRPO). Этот процесс направлялся функциями вознаграждения, оптимизирующими химическую валидность, новизну, разнообразие и высокую прогнозируемую аффинность связывания. При оценке на пяти белковых мишенях, значимых для диабетической нефропатии, DrugGen-2 значительно превзошла базовые модели (DrugGPT и DrugGen). Она продемонстрировала превосходную способность генерировать уникальные молекулы, большее структурное сходство с одобренными препаратами и улучшенные прогнозируемые аффинности связывания по всем мишеням. Докинговый анализ дополнительно подтвердил эти результаты, выявив кандидатные лиганды с высоким потенциалом связывания, включая соединения с прогнозируемой аффинностью (-9,917, -9,485 и -9,367), превышающей таковую для референтных препаратов, таких как эналаприл в отношении ангиотензинпревращающего фермента (-8,283). Интегрируя контекст, специфичный для заболевания, в генерацию молекул, DrugGen-2 продвигает AI-ассистированное открытие лекарств, предлагая мощный инструмент для de novo дизайна и перепрофилирования препаратов, учитывающий сложное взаимодействие между заболеваниями и молекулярными мишенями.
Растущий спрос на создание видео из изображений на мобильных устройствах все больше фокусируется на кинематографических эффектах движения, таких как «bullet time», наезд/отъезд камеры (dolly zoom), замедленная съемка и другие. Хотя диффузионные трансформеры (DiT) демонстрируют высокую производительность в генерации видео, их большой объем параметров и многошаговый итеративный процесс шумоподавления приводят к значительным вычислительным затратам, что затрудняет эффективную генерацию на мобильных устройствах. Мы предлагаем CineMobile для преодоления этого разрыва. В частности, CineMobile использует трехкомпонентную стратегию оптимизации: (1) применение дистилляции с направленным прунингом для получения компактной, но эффективной модели, сохраняющей основные возможности генерации видео, необходимые для кинематографических эффектов; (2) оптимизация сжатой модели в 4-шаговый генератор с помощью комбинации диффузионной дистилляции и обучения с подкреплением; (3) использование гибридного квантования после обучения для сжатия размера модели до менее 1 ГБ. Экспериментальные результаты показывают, что по сравнению с моделью-учителем на архитектуре Wan 2.1 CineMobile достигает ускорения генерации в 40 раз при сохранении сопоставимого визуального качества. В частности, CineMobile генерирует видео 480p из 49 кадров с задержкой шумоподавления на шаг 0,6 секунды на графическом процессоре NVIDIA H200 и 20 секунд на платформе MediaTek Dimensity 8400 Ultimate 5G, при пиковом использовании памяти 1,8 ГБ, что демонстрирует его практическую применимость для создания видео из изображений на мобильных устройствах.
Современные LLM всё чаще применяются в приложениях с длинным контекстом, таких как генерация с дополнением через поиск, программирование на уровне репозиториев и агентные рабочие процессы, чьи накопленные цепочки рассуждений и следы инструментов регулярно увеличивают входные данные на порядок за пределы окна предварительного обучения, что делает расширение контекста без дополнительного обучения доминирующим путём развёртывания для моделей с открытыми весами. Большинство существующих методов без обучения фиксируют единый коэффициент перемасштабирования заранее, поэтому агрессивный коэффициент жертвует точностью на коротких контекстах, а консервативный — выходит из строя на длинных. Мы предлагаем Jet-Long — метод без дообучения, который сочетает локальное окно, верное RoPE, с дальним окном, коэффициент перемасштабирования которого динамически адаптируется к текущей длине последовательности, точно восстанавливая базовую модель на коротких входных данных и чисто экстраполируя на длинных. Объединение внимания по принципу включения-исключения и поворот коррекции RoPE на лету делают бифокальную конструкцию практически бесплатной при инференсе; при слиянии в единое ядро CuTe префиллинг длинного контекста достигает до 1.39× пропускной способности FA2 на H100 (приближаясь к FA4, доступному только на Hopper), а однопакетная генерация вносит накладные расходы не более 4% на любой длине. На Qwen3-1.7B/4B/8B с контекстом до 128K Jet-Long превосходит RULER на +4.79/+2.18/+2.03~процентных пункта по сравнению с сильнейшим базовым методом при 1.7B/4B/8B, достигает наилучшей общей точности на HELMET-RAG (эталон, определённый HELMET как наиболее эффективный предиктор последующей производительности на длинном контексте) и получает наименьшую перплексию на PG-19. Jet-Long также обобщается на гибридные архитектуры внимания, такие как Jet-Nemotron, для дальнейшего улучшения работы с длинным контекстом без переобучения, и остаётся устойчивым к гиперпараметрам для удобства развёртывания.
Само-внимание позволяет каждому токену извлекать информацию из полного контекста, однако его квадратичная стоимость по длине последовательности ограничивает обучение и вывод при длинных контекстах. В данной статье представлено сравнительное исследование softmax-внимания и четырех недавних рекуррентных линейных архитектур внимания: DeltaNet, Gated DeltaNet, Kimi Delta Attention и Gated DeltaNet-2. Мы выражаем эти механизмы в единой нотации рекуррентной памяти, явно показывая, чем они различаются по выразительности, затуханию памяти, управлению стиранием и записью, пропускной способности обучения и сложности реализации. Наши эксперименты сосредоточены на моделях с 350 миллионами параметров, обученных на 15 миллиардах токенов, и включают сравнение оптимизаторов и скоростей обучения, сравнение гибридных и чистых стеков, измерения времени выполнения в зависимости от длины последовательности, более крупные запуски DeltaNet с 1,3 и 3 миллиардами параметров, а также небольшой набор downstream-оценок. Приведенные результаты по скорости измеряют пропускную способность обучения и время итерации; мы не предоставляем эмпирический эталон скорости вывода. В рамках описанного перебора моделей с 350 миллионами параметров и 15 миллиардами токенов Kimi Delta Attention с Muon достигает наименьших итоговых потерь на валидации, чистый стек Gated DeltaNet, обученный с AdamW, имеет наивысшую нормированную пропускную способность обучения, гибридные стеки в целом улучшают потери ценой снижения пропускной способности, а Muon последовательно снижает итоговые потери на валидации по сравнению с AdamW в оцененных нами конфигурациях с совпадающей архитектурой. Мы вводим и оцениваем легковесные механизмы межслойной маршрутизации для памяти типа DeltaNet. Наиболее естественная формулировка, вдохновленная DeltaNet — передача ошибки записи по дельта-правилу из нижнего слоя в целевое значение следующего слоя — не дает улучшений по сравнению с соответствующими базовыми линиями. Маршрутизация в выровненный скрытый поток и передача значения записи вместо ошибки дает скромное улучшение в сопоставимых запусках, которые мы сообщаем: межслойная маршрутизация значений (CLVR) снижает итоговые потери на валидации как для DeltaNet, так и для Gated DeltaNet.
Обучение с подкреплением (RL) стало стандартной парадигмой для улучшения сложных способностей к рассуждению больших языковых моделей (LLM). Для достижения эффективности выборки современные фреймворки RL полагаются на выборку по важности (IS). Однако такие алгоритмы страдают от дилеммы между исследованием и стабильностью. Чистая IS часто приводит к катастрофической нестабильности обучения, в то время как стандартные механизмы клиппирования, используемые для смягчения этой нестабильности, строго ограничивают бюджет обновления политики. Формализуя понятие емкости вероятности (Cap), мы показываем, что консервативное клиппирование структурно подавляет исследование, преждевременно урезая бюджет обновления для правильных, но маловероятных путей рассуждения. Чтобы выйти за рамки этих ограничений, мы предлагаем Неограниченную Положительную Асимметричную Оптимизацию (UP) — универсальную и готовую к внедрению целевую функцию. UP теоретически перестраивает процесс оптимизации, фиксируя политику относительно ее текущего состояния с помощью оператора остановки градиента. Такая асимметричная конструкция открывает неограниченные стабильные градиенты для положительных преимуществ, чтобы максимизировать исследование, сохраняя при этом стандартные средства защиты клиппирования для отрицательных преимуществ во избежание нестабильности обучения. Кроме того, наша формулировка легко расширяется на различные гранулярности оптимизации, включая токен-уровневые (GRPO, DAPO) и последовательностные (GSPO) фреймворки. Обширные эксперименты показывают, что UP повышает способность к исследованию и обеспечивает превосходную точность рассуждений в различных алгоритмах RL (DAPO, GSPO, GRPO), архитектурах моделей (плотные, MoE и языково-визуальные) и режимах обучения (языковой и мультимодальный), подтверждая UP как действительно универсальное и готовое к внедрению улучшение для обучения на основе RL.
В задачах с длинным горизонтом релевантное для принятия решений состояние часто разбросано по расширяющейся траектории, тогда как агент действий должен извлечь его и действовать. По мере роста траекторий требования задачи, факты среды, предыдущие попытки, диагнозы и открытые подцели могут быть погребены в окне контекста или вытеснены за его пределы, не оказывая влияния на решения, когда это необходимо. Мы называем этот режим отказа «затуханием поведенческого состояния». Мы изучаем память как механизм активного вмешательства, а не пассивного извлечения. Отдельный агент памяти работает вместе с неизменным агентом действий, обновляя структурированное хранилище памяти на основе недавней траектории и принимая решение о том, следует ли внедрить напоминание, основанное на памяти, или оставаться в бездействии. Модуль подключается и работает с передовыми агентами действий и существующими обвязками агентов. На Terminal-Bench 2.0 и τ^2-Bench он улучшает pass@1 как для более слабых, так и для более сильных агентов действий, с приростами в +8,3 п.п. на Terminal-Bench и +6,8 п.п. на τ^2-Bench. Абляции показывают, что селективное вмешательство превосходит пассивное использование банка, постоянное внедрение, только советующее руководство и общее извлечение. В качестве первого шага к политикам памяти с открытыми весами мы обучаем Qwen3.5-27B на SETA с помощью SFT и GRPO, улучшая валидационное вознаграждение и достигая частичного переноса на Terminal-Bench.
Сверхразрешение в магнитно-резонансной томографии (МРТ) имеет решающее значение для повышения диагностической доступности, однако большинство методов рассматривают его как детерминированное отображение фиксированного входа с низким разрешением в цель с высоким разрешением. При этом упускается ключевое свойство физики МРТ-сбора данных: пространственное разрешение и отношение сигнал/шум (ОСШ) неразрывно связаны, поэтому любое заданное сканирование с низким разрешением представляет собой лишь одну из множества возможных реализаций при различных компромиссах в процессе сбора данных. Мы переосмысливаем сверхразрешение МРТ как физически обоснованную задачу реконструкции, в которой цель состоит в определении оптимальной конфигурации разрешение-ОСШ с последующим сверхразрешением для получения высококачественных МРТ-результатов. Ключевым следствием такой постановки является то, что разрешение МРТ становится динамическим, а не фиксированным. Для обработки таких неоднородных по разрешению входных данных мы адаптируем 2D-рассеяние Гаусса (2D GS) к МРТ, формулируя реконструкцию как задачу рендеринга на основе координат, инвариантную к разрешению. Для дальнейшего повышения точности мы вводим три инновации: (1) представление Гаусса с использованием априорной информации, объединяющее априорную информацию об анатомической структуре для инициализации ядер, специфичных для тканей, и априорную информацию об изображающей системе, отражающую характеристики оборудования с помощью ковариационного словаря; (2) схему моделирования сигнала с физическими ограничениями, которая предсказывает внутренние параметры тканей (плотность протонов ρ и эффективную скорость релаксации R2) и синтезирует интенсивности через управляющие физические уравнения, обеспечивая биофизически правдоподобный контраст; и (3) фреймворк мета-обучения, который смягчает нехватку парных данных за счет предварительного обучения на симулированных данных и адаптации к реальным условиям. Обширные эксперименты на наборах данных с динамическим разрешением и стандартных эталонных тестах показывают, что наш метод достигает самых современных результатов, подчеркивая его высокий потенциал для клинического применения.
Масштабирование времени логического вывода для генерации изображений по текстовому описанию эволюционировало от простой выборки "лучший из N" (Best-of-N, BoN) до направленных методов поиска, которые проверяют и направляют кандидатные траектории на промежуточных этапах шумоподавления. Эти подходы сосредоточены на том, когда и как часто проводить проверку в процессе шумоподавления, но в значительной степени рассматривают стоимость самой генерации как фиксированную. Более того, стандартная практика сравнения методов по количеству вычислений функции (Number of Function Evaluations, NFEs) учитывает только прямые проходы шумоподавления и игнорирует накладные расходы на проверку, что может искажать рейтинги эффективности. Мы показываем, что при оценке по реальному времени простая BoN уже сравнивается или превосходит несколько направленных методов поиска, что позволяет предположить, что вычислительные ресурсы лучше тратить на более широкое исследование, чем на повторные промежуточные проверки. Это мотивирует разработку Flash-BoN, который генерирует большой пул недорогих черновых кандидатов, комбинируя три взаимодополняющих регулятора ускорения: усечение временных шагов, пропуск слоев и прокси активаций — в единую конфигурацию, оптимизируемую один раз для каждой модели. Затем эффективная многоэтапная процедура проверки определяет наиболее перспективный черновик, который уточняется с полным качеством. На трех эталонных наборах данных и для трех масштабов моделей Flash-BoN стабильно превосходит все базовые методы при фиксированных бюджетах реального времени, причем выигрыш возрастает с увеличением масштаба модели (+8% AUC). Мы также показываем, что наша стратегия хорошо сочетается с существующими ортогональными методами, такими как оптимизация подсказок на основе рефлексии, и улучшает их (+16% AUC). Полученные выигрыши коррелируют с возросшим разнообразием кандидатов, что также позволяет использовать черновой отбор для ускорения сходимости последующего обучения с подкреплением.
Семантические аудиоприложения всё чаще требуют контролируемой генерации на массовом и встраиваемом оборудовании, а не через основанные на фреймворках датацентровые стеки. Мы представляем aria — независимую среду выполнения без внешних зависимостей, которая запускает полный конвейер «текст–музыка» Stable Audio 3 (SA3) на обычных GPU, машинах без GPU и Raspberry Pi 5, не требуя ни Python, ни фреймворков глубокого обучения. Наш основной вклад — исследование квантования: работа модели с пониженной числовой точностью для соответствия ограниченному бюджету памяти, при этом экономия памяти достигается на месте, без её расширения. Поскольку среда выполнения владеет каждым внутренним тензором, она также предоставляет управление активациями — недорогой способ направлять генерируемый моделью результат. Мы оцениваем потери качества с помощью трёх независимых метрик выходных данных (соответствие промпту, общее качество аудио, сохранение вкусовых ассоциаций), каждая из которых сравнивается с обычной вариацией между случайными начальными значениями. Восьмибитная точность не показывает измеримой потери качества ни по одной метрике, при этом резко сокращает потребление памяти и оказывается самым быстрым режимом на GPU; четырёхбитная вносит небольшие, ограниченные затраты, но уменьшает занимаемый объём настолько, что модель с 1,2 миллиарда параметров запускается на 8-гигабайтном Pi. По сравнению с официальной реализацией aria соответствует или превосходит скорость генерации и запускается примерно в семь раз быстрее. Пример использования интерфейса управления генерирует музыку, несущую вкусовые ассоциации (звуковой привкус), с реальным, но ограниченным контролем над подмножеством атрибутов. Эти результаты делают компактную среду выполнения с квантованием и встроенным управлением практической основой для устройств семантического аудио в контексте «Интернета звуков». Среда выполнения aria опубликована по адресу https://github.com/matteospanio/aria.
Большие языковые модели (LLM) всё чаще выступают в роли интегрированных агентов науки о данных, сочетая абстрактное рассуждение с продвинутым использованием инструментов. Однако существующий ландшафт бенчмарков в значительной степени разделяется на бенчмарки символического причинного рассуждения без реалистичного анализа данных и бенчмарки анализа данных без принципиальной причинно-следственной структуры генерации данных. Более того, существующие наборы данных для оценки причинности часто ограничены подобранными примерами из имеющихся источников, а их разнообразие обеспечивается ограниченными шаблонными вариациями, а не систематической генерацией новых синтетических причинных структур. Мы представляем CausalDS — бенчмарк для оценки причинного рассуждения в агентных рабочих процессах науки о данных. Каждый экземпляр бенчмарка представляет собой сцену, состоящую из выборочной структурной причинной модели (SCM) с сгенерированными наблюдательными данными и сопровождающим синтетическим повествованием на естественном языке, основанным на реалистичной предметной области. При необходимости мы обосновываем состав компонентов бенчмарка эмпирическими распределениями, полученными из реальных наборов данных, таким образом сохраняя эмпирическую структуру, но снижая риск «причинного попугайничества» за счёт полностью синтетической генерации. На основе каждой сцены мы затем выводим задачи, охватывающие все три ступени Пирла, причём типичные задачи прогнозирования в науке о данных появляются как Ступень 1. Большинство задач включают компонент программирования в науке о данных, где модели обычно требуется использовать несколько инструментов для получения окончательного ответа из-за частого наличия несовершенных наблюдений, генерируемых моделью наблюдения. Кроме того, распознавание случаев, когда вопрос не допускает обоснованного ответа, и воздержание от ответа рассматривается как первостепенный оцениваемый результат. Таким образом, бенчмарк совместно оценивает символическое причинное рассуждение, науку о данных, количественную оценку неопределённости, воздержание от ответа, а также использование инструментов и программирование.
В классе квантовых схем, известном как схемы с выраженным пиком, задача состоит в предсказании наиболее вероятной битовой строки на выходе схемы. Поскольку такие схемы спроектированы так, чтобы их выходное распределение имело резкий пик, в принципе их можно моделировать с помощью усеченного вектора состояния с ограниченным числом членов или долей от общей вероятностной массы. Такое приближенное моделирование может быть выполнено на классическом компьютере с разреженным представлением, хранящим только ненулевые амплитуды вектора состояния, в отличие от плотных представлений, распространенных в большинстве квантовых симуляторов. Для эффективности все операции над вектором состояния должны быть по возможности векторизованы, а при наличии также может использоваться аппаратное ускорение. В данной работе описывается, как эти требования были выполнены в реализации с открытым исходным кодом, и обсуждаются её производительность и ограничения.
Современная сегментация объектов видео (VOS) включает отслеживание и сегментирование заданных пользователем целей. Хотя недавние подходы достигли высокой производительности в сценариях с одной целью, их расширение на многоцелевые конфигурации обычно требует дублирования обработки одной цели для каждого отдельного объекта, что приводит к снижению частоты кадров (FPS) с неограниченной задержкой при увеличении количества целей. На основе Segment Anything 2 (SAM2) мы предлагаем SAM-MT, который решает эту проблему, преобразуя модель в интерактивную структуру для сегментации видео с несколькими целями в реальном времени. SAM-MT использует явные запросы для представления различных отдельных целей параллельно с общим представлением глобального контекста. В нем применяется разделенное маскированное внимание для сохранения индивидуальных идентификаторов в условиях перекрестных помех между целями, а также разреженная память для стабильной временной эволюции, наряду со специализированными стратегиями обработки окклюзий и предотвращения перекрытий. SAM-MT успешно отделяет задержку от числа целей, достигая скорости реального времени на уровне базовых алгоритмов для одной цели (>36 FPS для 10 целей), сохраняя при этом надежную производительность сегментации видео SAM2.
Ключевая проблема в обработке арабского языка (NLP) заключается в нехватке данных на диалектах по сравнению с современным стандартным арабским языком (MSA), что приводит к чрезмерной генерации MSA большими языковыми моделями (LLM) и их затруднениям при точном порождении диалектных текстов. С точки зрения интерпретируемости это ставит фундаментальный вопрос: где и как диалектные признаки кодируются во внутренних представлениях модели, и можно ли использовать эти репрезентации для улучшения генерации диалектов без дообучения? В данном исследовании рассматриваются два взаимодополняющих подхода на этапе инференса, которые одновременно служат как средствами интерпретируемости, так и механизмами управления. Во-первых, мы проводим анализ на уровне нейронов, выявляя разреженные популяции нейронов, кодирующие диалектно-специфические признаки, и показывая, что усиление или подавление этих нейронов может направлять выходные данные модели в сторону целевых диалектов. Во-вторых, мотивированные запутанностью диалектных признаков на уровне отдельных нейронов, мы применяем подход векторного управления, который извлекает диалектно-специфические направления активации и внедряет их во время инференса. В совокупности эти методы освещают геометрию диалектных знаний в арабских LLM и предлагают принципиальный, основанный на интерпретируемости фреймворк для контроля над диалектами, не требующий диалектно-специфического дообучения.
Мы представляем PAST-TIDE — нашу систему определения позиции, решающую обе подзадачи общей задачи StanceNakba на NakbaNLP@LREC-COLING 2026. Основная идея заключается в настройке высказываний (statement tuning). Мы переопределяем понятие позиции как маскированное языковое моделирование (MLM) по типу клоз-теста, позволяя вербализатору сопоставлять слова-метки с категориями позиции через предварительно обученную голову MLM, а не добавлять случайно инициализированную классификационную голову. Мы дополняем это прототипическим контрастивным обучением, которое использует обучаемые прототипы классов для контрастивного обучения, независимого от размера пакета, и тематически-условной нормализацией слоев для кросс-тематического определения позиции в арабском языке. PAST-TIDE достигает макро-F1 показателей 0,75 для подзадачи A и 0,74 для подзадачи B в официальной таблице лидеров, что указывает на то, что минимальные архитектурные дополнения к предварительно обученной модели могут оставаться конкурентоспособными в условиях ограниченных ресурсов.