Ежедневно отобранные исследовательские статьи по ИИ с переводами
Недавние достижения в области понимания видео охватывают движение, длинные видео и потоковое взаимодействие, приближая эту область к реальным приложениям. Несмотря на этот прогресс, современные открытые модели по-прежнему имеют ряд ограничений. Они часто плохо обобщают различные типы видео, что делает их эффективными только в конкретных доменах. Высокие вычислительные требования дополнительно ограничивают их эффективность и масштабируемость. Более того, большинство моделей являются лишь частично открытыми: ключевые компоненты, такие как код обучения, стратегия или наборы данных, недоступны, что затрудняет воспроизводимость и замедляет развитие сообщества. Для решения этих проблем мы представляем VideoChat3 — полностью открытую, эффективную и универсальную видеориентированную мультимодальную большую языковую модель (MLLM). VideoChat3 продвигает понимание видео с помощью двух взаимодополняющих подходов. Для эффективности мы внедряем Расширенный 3D-трансформер зрения (I3D-ViT) и Адаптивное разрешение кадров для восприятия потокового видео, что обеспечивает эффективное пространственно-временное представление и снижает затраты на обработку видеовходов во время обучения и инференса. Для результативности мы разрабатываем масштабируемый конвейер синтеза видеоданных, который формирует три разнообразных высококачественных набора данных для обучения: VideoChat3-Academic2M, VideoChat3-LV116K и VideoChat3-OL617K, охватывающих общие, длинные и потоковые видеосценарии, что улучшает обобщение модели между доменами. Интегрируя эти решения, VideoChat3 достигает редкого баланса между широкой обобщаемостью и вычислительной эффективностью. Эксперименты на общих, длинных и потоковых бенчмарках показывают, что VideoChat3 превосходит предыдущие открытые модели с равным или большим количеством параметров, имея всего 4B параметров и более высокую эффективность.
Большие языковые модели всё чаще обучаются как интерактивные агенты для долгосрочных задач, предполагающих многошаговое взаимодействие, использование инструментов и обратную связь от среды. Обучение с подкреплением (RL) на основе результатов предоставляет практическую парадигму оптимизации, однако её разреженные вознаграждения на уровне траекторий дают ограниченные указания для промежуточных решений, создавая разрыв в контроле между результатами эпизодов и обучением политики на уровне токенов. Мы предлагаем SEED (Self-Evolving On-Policy Distillation) — саморазвивающуюся структуру, которая преобразует завершённые он-политические траектории в ретроспективные навыки на этапе обучения и дистиллирует их поведенческий эффект обратно в модель политики. SEED сначала дообучает политику для анализа завершённых траекторий и генерации навыков на естественном языке, фиксирующих повторно используемые рабочие процессы, ключевые наблюдения или правила предотвращения ошибок. Во время RL текущая политика одновременно собирает траектории и выступает в роли анализатора, извлекающего из этих траекторий ретроспективные навыки. Таким образом, обновления политики улучшают как последующие решения, так и анализ навыков, позволяя ретроспективному контролю развиваться вместе с политикой. Затем SEED повторно оценивает выбранные действия в обычном и дополненном навыками контекстах, преобразуя сдвиг вероятностей, вызванный навыками, в плотный он-политический сигнал дистилляции на уровне токенов. Этот сигнал оптимизируется совместно с RL на основе результатов, что позволяет вспомогательному контролю оставаться согласованным с текущим распределением траекторий. Обширные эксперименты на текстовых и визуальных агентных задачах показывают, что SEED последовательно улучшает производительность и эффективность использования выборок, демонстрируя устойчивое обобщение на невиданные сценарии. Наш код доступен по адресу https://github.com/jinyangwu/SEED.
Последние достижения в области интегрированных с инструментами больших языковых моделей сделали веб-поиск ключевой функцией агентов, ориентированных на получение информации. Однако по мере роста истории взаимодействий агенты всё чаще испытывают трудности с отслеживанием прогресса задачи. Когда попытки поиска не приносят полезных доказательств, современные одно- и мультиагентные системы могут зацикливаться, растрачивая поисковый бюджет и в конечном итоге ухудшая качество и полноту итогового результата. Мы представляем SearchOS — системный мультиагентный фреймворк, превращающий хрупкий, неявный прогресс поиска в явное, персистентное и разделяемое состояние. Во-первых, мы формулируем открытый поиск информации как заполнение реляционной схемы с обоснованными цитатами, где агенты обнаруживают сущности, заполняют атрибуты в связанных таблицах и привязывают каждое значение к исходному доказательству. Затем мы разрабатываем контекстное управление, ориентированное на поиск (SOCM), которое выносит эволюционирующее состояние во фронтальные задачи, граф доказательств, карту покрытия и память о неудачах. Построенный на SOCM, SearchOS применяет конвейерно-параллельный механизм планирования, который перекрывает выполнение под-агентов и постоянно заполняет освободившиеся слоты задачами, нацеленными на устранение неохваченных пробелов, повышая загрузку и пропускную способность. Для планирования и контроля выполнения поисковых агентов SearchOS вводит промежуточный уровень управления инструментами поиска, который перехватывает взаимодействия модели и инструментов для записи обоснованных доказательств и реагирует на задержки или исчерпание бюджета, а также предоставляет повторно используемую иерархическую систему навыков, состоящую из стратегических навыков и навыков доступа, чтобы дополнить процесс поиска агентов и избежать повторения неудачных шаблонов поиска между запусками. На наборах данных WideSearch и GISA SearchOS превосходит все показатели среди оценённых одно- и мультиагентных базовых решений, прокладывая путь к надёжному информационному сотрудничеству.
Растущий разрыв отделяет длины контекста инференса от посттренировки с RL: системы инференса приближаются к контекстам в миллион токенов, в то время как нагрузки посттренировки часто остаются на уровне 256K токенов или ниже и полагаются на обобщение по длине при развёртывании. Этот разрыв особенно важен для ИИ-агентов, чьи наблюдения, результаты работы инструментов, документы и предыдущие решения накапливаются в длинных траекториях. LongStraw — это учитывающий архитектуру стек выполнения для миллион-токенной посттренировки с RL при фиксированном бюджете GPU, инстанцированный с помощью Group Relative Policy Optimization (GRPO). Он вычисляет общий промпт без autograd, сохраняет только специфичное для модели состояние, необходимое для последующих токенов, и воспроизводит короткие ветви ответов по одной за раз, уменьшая живой граф обучения ценой дополнительного времени воспроизведения. Мы реализуем его для гибридной рекуррентной и полной внимания модели Qwen3.6-27B и модели GLM-5.2 со сжатым вниманием и смесью экспертов. На восьми GPU H20 LongStraw выполняет групповое оценивание Qwen и обратное распространение ответов на 2,1 миллиона позиций для групп размером 2 и 8; увеличение размера группы добавляет всего 0,21 ГБ пиковой выделенной памяти, в то время как отдельный стресс-тест достигает 4,46 миллиона позиций. На 32 GPU H20 мы валидируем сквозной путь выполнения LongStraw для промпта из 2,1 миллиона токенов через все 78 слоёв GLM-5.2. Эти эксперименты устанавливают ёмкость выполнения, а не полную корректность обучения, поскольку захваченное состояние промпта отсоединено, а некоторые распределённые пути прямого распространения и композиции градиентов остаются неполными.
Модели мира-действия (World-Action Models, WAM) становятся перспективной основой для воплощенного управления: вместо прогнозирования только действий они обучают представления, связывающие генерацию действий с прогнозированием будущего мира. Эта связь часто рассматривается как источник устойчивости, интерпретируемости и безопасности, поскольку действие робота в принципе можно проверить на соответствие его воображаемому будущему. В данной работе мы показываем, что это предположение является хрупким. Мы представляем BadWAM — единую среду для моделирования и оценки атак дрейфа мира-действия (World-Action Drift Attacks): нового класса состязательных атак, специфичных для WAM, которые используют малые визуальные возмущения для нарушения согласованности между тем, что WAM воображает, и тем, что она выполняет. BadWAM характеризует эту поверхность атаки по двум естественным критериям: сила атаки и скрытность. Когда противник отдает приоритет нарушению, BadWAM реализует состязательную атаку только на действия, которая напрямую подталкивает модель к действиям, ведущим к сбою задачи. Когда противник дополнительно отдает приоритет скрытности, BadWAM реализует состязательную атаку с сохранением воображения, которая стремится вызвать вредные сдвиги действий, удерживая прогнозируемое моделью будущее близким к ее чистому воображению. Вместе эти две атаки охватывают спектр сбоев, специфичных для WAM: от явного перехвата действий до более скрытных случаев, когда модель, по-видимому, воображает правдоподобное будущее, но выполняет десинхронизированное действие. Мы оцениваем BadWAM на различных вариантах WAM. Результаты показывают, что наши атаки существенно снижают показатели успешности выполнения задач в замкнутом цикле. Например, наша атака только на действия снижает производительность модели с 96,5% до 43,1% успешных попыток. Результаты атаки с сохранением воображения дополнительно выявляют уязвимость, специфичную для WAM: умеренная регуляризация сохранения будущего может поддерживать высокую эффективность атаки, уменьшая при этом дрейф воображения будущего.
Генерация видео всё чаще опирается на подходы, основанные на ключевых кадрах, когда создатели задают последовательность эталонных изображений для управления генерацией. Хотя современные модели поддерживают мультиключевое обусловливание, остаётся неясным, способны ли они точно воспроизводить заданные ключевые кадры, сохраняя при этом общее качество видео. Мы представляем KeyFrame-Compass — первый всеобъемлющий бенчмарк для оценки генерации видео по ключевым кадрам. Бенчмарк содержит 386 тщательно отобранных образцов, охватывающих три области применения, две структуры видео, две степени детализации промптов, два формата обусловливания и четыре плотности ключевых кадров, что позволяет проводить контролируемый анализ в различных условиях генерации. Мы также предлагаем автоматизированную систему оценки, которая совместно измеряет точность воспроизведения ключевых кадров и общее качество видео. В частности, мы разбиваем точность воспроизведения ключевых кадров на шесть взаимодополняющих метрик, охватывающих наличие, верность, временную упорядоченность, локализацию, устойчивость и уникальность, а общее качество видео оцениваем с помощью обоснованных суждений мультимодальных больших языковых моделей (MLLM), дополненных специализированными моделями восприятия. Эксперименты на девяти репрезентативных системах генерации видео выявили ряд фундаментальных ограничений. Современные модели демонстрируют явный компромисс между точным воспроизведением ключевых кадров и естественным синтезом видео. Их производительность дополнительно ухудшается по мере увеличения плотности ограничений по ключевым кадрам, а большинство моделей с открытым исходным кодом также не способны интерпретировать раскадровочные сетки как временно упорядоченные последовательности ключевых кадров.
Генерация аудио-видео на основе множественных референсов (MR2AV) направлена на создание согласованного аудио-видео контента на основе множественных референсов и текстовых инструкций. Существующие бенчмарки в основном сосредоточены на тексто-управляемой генерации, сохранении единичного референсного объекта или изолированном согласовании аудио и видео, оставляя новую постановку MR2AV в значительной степени неисследованной. По сравнению с этими постановками, MR2AV требует от моделей совместного рассуждения над множественными референсами при генерации синхронизированного визуального и аудиоконтента. Модели должны не только точно сохранять каждый референс, но и правильно связывать и компоновать множество реферируемых сущностей в согласованные аудиовизуальные события. Для устранения этого пробела мы представляем MultiRef-Compass — унифицированный бенчмарк для генерации MR2AV. Он включает 350 тщательно отобранных образцов, созданных с помощью масштабируемого и контролируемого конвейера композиции ресурсов, охватывающего сохранение объекта с нескольких ракурсов, связывание множества сущностей и композицию человек-объект-сцена. Для обеспечения интерпретируемой оценки MultiRef-Compass определяет протокол оценки по четырем измерениям: базовое качество, согласованность с референсами, аудиовизуальная согласованность и следование инструкциям, с использованием 14 подметрик. MultiRef-Compass интегрирует автоматические метрики с фреймворком MLLM-как-Судья с усилением переоценки, что обеспечивает масштабируемую и проверяемую оценку как перцептивного качества, так и композиции с учетом референсов. Обширные эксперименты на восьми репрезентативных системах MR2AV выявляют значительные возможности для улучшения по нескольким оценочным измерениям, подчеркивая необходимость в комплексном бенчмарке и позиционируя MultiRef-Compass как основу для будущих исследований MR2AV.
Человеческое познание не разделяет понимание и генерацию. Учитель у доски одновременно говорит и рисует, каждая модальность изменяет другую. В данной работе мы переносим этот взаимосвязанный цикл на искусственные системы. Маскированные диффузионные модели (MDMs) идеально подходят для этой задачи, однако существующие сэмплеры либо декодируют текст и изображение чередующимся образом, либо независимо обновляют их в параллельных ветвях, совместно использующих только историю предыдущего шага, но не последние решения другой модальности в пределах одного шага; в сочетании с неспособностью MDMs к перемаскированию, кросс-модальные противоречия не выявляются и не исправляются. Мы представляем самокорректирующиеся связанные марковские прыжковые процессы (SC-CMJP) — фреймворк, в котором интенсивности переходов одной модальности являются функционалами оценки уверенности другой модальности, взвешенной с помощью кросс-модального внимания. Кроме того, прыжок с перемаскированием отзывает принятые решения в тот момент, когда кросс-модальные данные свидетельствуют против них. В сочетании с SC-CMJP мы представляем CO₂Jump (Self-Correcting Coupled Jump) — новый сэмплер без обучения с однопроходной выборкой для совместной мультимодальной генерации. Для целей обучения и оценки мы создали и опубликуем три крупномасштабных корпуса совместной мультимодальной генерации: JEdit-1M, JMaze-200K, JNono-200K с соответствующими бенчмарками в распределении и вне его. CO₂Jump достигает наилучшей совместной производительности для понимания и редактирования изображений, а также визуального рассуждения (решения лабиринтов и нонограмм). Эффективность сэмплера монотонно возрастает с увеличением числа шагов шумоподавления, что служит свидетельством накопления преимуществ кросс-модальной связи на протяжении всей траектории. Страница проекта: https://coupled-jump.github.io
Построение интерактивных миров, которые адекватно реагируют на действия игрока, издавна является общей целью компьютерной графики, игр и искусственного интеллекта. Современные видеогенеративные модели предлагают путь, основанный на данных, для достижения этой цели, предсказывая будущие наблюдения, обусловленные действиями пользователя, и всё чаще рассматриваются как потенциальные игровые движки следующего поколения. Однако реализация по-настоящему интерактивного игрового мира требует результатов взаимодействия, которые следуют правилам, применимым к меняющимся игровым условиям, последствий, сохраняющихся на длительных горизонтах, и цикла генерации, работающего в реальном времени. Традиционные игровые движки реализуют эти свойства через повторяющийся цикл «действие-состояние-наблюдение», в котором действия игрока обновляют явное состояние игры в соответствии с заданными правилами, а наблюдения визуализируются на основе полученного состояния. Используя этот цикл в качестве организующей призмы, данная статья рассматривает моделирование интерактивного игрового мира по четырём измерениям: контроль действий игрока, динамика состояний игры, сохранность связи «состояние-наблюдение» и интерактивная генерация в реальном времени. Для каждого измерения мы начинаем с требований, предъявляемых к интерактивному игровому миру, группируем существующие подходы в репрезентативные семейства и обсуждаем сильные стороны и компромиссы каждого семейства. В дополнение к этому анализу мы представляем масштабируемый механизм сбора данных для игры Black Myth: Wukong, который собирает более 90 часов игрового процесса с покадрово синхронизированными действиями игрока, эталонными состояниями игры и визуальными наблюдениями, а также структурированными и семантическими аннотациями, в качестве ресурса для моделирования игрового мира с учётом состояний. Мы надеемся, что данная статья даёт чёткое представление о текущем состоянии области и способствует прогрессу в направлении интерактивных игровых миров.
Обучение обширным знаниям о мире непосредственно на основе необработанных визуальных данных является фундаментальной способностью интеллекта. Мы представляем UniVR — первое исследование, посвященное одновременному обучению сложным рассуждениям, детальной физической динамике и долгосрочному планированию на основе чистых визуальных демонстраций. В основе UniVR лежит VR-GRPO — парадигма обучения с подкреплением, использующая взаимодополняющие глобальные и пошаговые вознаграждения. Этот подход обеспечивает логическую связность и физическую согласованность на протяжении всего процесса рассуждений, не требуя предметно-ориентированных эвристик или пар изображение-текст. Для обучения и оценки UniVR мы создали VR-X — крупномасштабный эталон, собранный из 16 разнообразных источников, охватывающих долгосрочные манипуляции, пространственные головоломки и физические рассуждения. Это первый комплексный набор для оценки этих разнородных способностей в рамках чисто визуального протокола. Примечательно, что UniVR достигает улучшения до 25% на VR-X, а его превосходные визуальные рассуждения также повышают производительность на различных эталонах мультимодального понимания. Эти результаты подчеркивают огромный потенциал рассуждений в визуальных пространствах; весь код, данные и модели открыты для дальнейших исследований.
Обучение с подкреплением стало стандартной методикой пост-обучения для больших языковых моделей, однако плотные обновления всех параметров создают два узких места, актуальных для развертывания: подавленная производительность рассуждений, часто проявляющаяся в преждевременном насыщении масштабирования во время тестирования, и интерференция при консолидации множества способностей посредством многодоменного обучения или слияния моделей. Мы показываем, что эффективная для рассуждений компонента этих обновлений во многом сосредоточена в спектральном пространстве базовой модели, что мотивирует разработку метода «Перестройка с выравниванием подпространства» (SAR) – метода пост-фактум редактирования, который сохраняет это спектральное ядро, удаляя ортогональные компоненты. Таким образом, SAR сохраняет улучшения в рассуждениях и отфильтровывает остаточные направления обновлений, подавляющие производительность или усиливающие междоменную интерференцию. На нескольких семействах моделей и масштабах SAR извлекает компактные ядра рассуждений, используя всего около 0,58% от общего числа параметров: он сохраняет более 99% производительности после обучения, улучшает исследование с высокими k в математических рассуждениях и обобщается на агентное программирование, улучшая шесть из семи открытых бенчмарков на внутренней модели. SAR также очищает смешанные обновления обучения по доменам, высвобождая подавленную способность к программированию при сохранении математических рассуждений и следования инструкциям. Кроме того, он позволяет объединять модели разных экспертов, обеспечивая междоменную генерализацию, которая превосходит предыдущие базовые методы объединения и даже лучших однодоменных экспертов. В целом, SAR показывает, что извлечение эффективных для рассуждений обновлений из геометрии параметров может служить механизмом без обучения для улучшения рассуждений и многодоменной производительности.
Мы представляем Wan-Streamer v0.3, который переосмысляет нашу модель нативной стриминговой интеракции в рамках единой организующей концепции: видео — это мир плюс поток событий. Мир представляет собой устойчивый контекст, в котором разворачивается видео, включая окружение, сцену, субъекты, акустические условия окружающей среды, характеристики голоса и другие относительно стабильные условия. Поток событий — это всё, что изменяется со временем в рамках этого мира, включая изменения сцены или окружения, поведение субъектов, речь и другие звуки. Это порождает универсальную задачу предобучения на больших объёмах реального видео: имея мир и входящие данные, предсказывать, как мир движется, изменяется и реагирует в реальном времени. Полученная компетенция может быть специализирована для широкого семейства задач реального времени с последующей донастройкой. Мы реализуем её в режиме реального времени для полноценной дуплексной аудиовизуальной интеракции, где поток событий представляет собой речь агента вместе со свободно формируемым поведением. Функционально процесс мультимодального понимания модели подобен модели «зрение-язык-действие»: он преобразует мультимодальный ввод пользователя в речевые и поведенческие действия в языковой форме. Wan-Streamer v0.3 сохраняет рабочие точки v0.2: видео 640×368 при 25 кадрах/с, единица потоковой передачи 160 мс, задержка ответа модели около 200 мс и общая задержка взаимодействия около 550 мс при двунаправленном сетевом бюджете 350 мс.
Дистилляция на политике (OPD) стала ключевой парадигмой в пост-обучении больших языковых моделей (БЯМ), однако её тренировочная динамика остаётся плохо изученной. Мы представляем систематическое исследование, посвящённое роли, патологиям и регуляции OPD. Сначала мы уточняем роль OPD как катализатора исследования: она направляет студента к корректным путям рассуждения посредством плотного токен-уровневого руководства, не расширяя при этом потолка возможностей. Мы подтверждаем это, демонстрируя, что разнообразие промптов важнее числа выборок на задачу, и, критически, что эффективность OPD полностью зависит от качества её направляющего сигнала. Эта зависимость выявляет две патологии, которые сбивают исследование с курса. Несоответствие студент-учитель возникает, когда большой разрыв в распределениях между учителем и студентом приводит к тому, что направляющий сигнал расходится с корректностью задачи, направляя исследование в контрпродуктивные направления. Эксплуатация длины возникает, когда агрегированная токен-уровневая цель создаёт зависящие от длины сокращения пути, позволяя студенту манипулировать ландшафтом вознаграждений через усечение ответов или избыточное дополнение, исследуя вырожденные моды длины вместо стратегий рассуждения. Для устранения этих патологий мы исследуем лёгкие сигнальные регуляции: ограничение преимущества и логарифмическое сжатие, обеспечивая, чтобы исследование направлялось достоверными сигналами. Эксперименты на семи бенчмарках показывают, что эти регуляции уменьшают эксплуатацию длины и обеспечивают эффективную дистилляцию, стабильно превосходя варианты OPD и базовые линии RLVR, тем самым подтверждая, что успешное исследование в OPD определяется качеством хорошо регулируемого сигнала, а не просто масштабом учителя.
Современные фундаментальные модели роботов работают с одношаговым или краткосрочным визомоторным контекстом. Мы представляем RoboTTT (Test-Time-Training Robot Policies) — модель робота и методику обучения, которые масштабируют визомоторный контекст до 8 тысяч временных шагов, что на три порядка превышает возможности современных политик, при этом без увеличения задержки вывода. При такой длине контекста мы открываем новые возможности для роботов: однократное внутриконтекстное имитационное обучение по видеодемонстрациям человека, оперативное улучшение политики, устойчивость к возмущениям и более высокую производительность в многоэтапных задачах с длинным горизонтом. Мы также впервые наблюдаем устойчивый прирост эффективности замкнутого управления по мере масштабирования длины контекста предобучения. В основе RoboTTT лежит интеграция обучения во время тестирования (Test-Time Training) в фундаментальные модели роботов, такие как политики "видение-язык-действие", что дает модель последовательности, рекуррентное состояние которой состоит из быстрых весов — параметров, обновляемых градиентным спуском как во время обучения, так и во время вывода; это сжимает историю в пространство весов и извлекает контекстную информацию для длинного контекста. Для масштабирования длины контекста обучения методика объединяет принуждение к выполнению последовательности действий с усеченным обратным распространением во времени. В сложных задачах управления реальными роботами RoboTTT улучшает общую производительность на 87% по сравнению с базовым одношаговым контекстом и полностью выполняет пятиминутную десятиэтапную задачу сборки, которую не выполняет ни один базовый метод. RoboTTT, обученный с контекстом в 8 тысяч шагов, превосходит ту же модель, предобученную с контекстом в 1 тысячу шагов, на 62%, что указывает на длину контекста как новую ось масштабирования для фундаментальных моделей роботов. Видео доступны по адресу https://research.nvidia.com/labs/gear/robottt/
Генераторы MeanFlow обеспечивают быструю выборку за несколько шагов, предсказывая средние скорости на временных интервалах, что делает их привлекательными для эффективной генерации. Обучение с подкреплением (RL) стало мощным инструментом для согласования диффузионных моделей и моделей потоков с человеческими предпочтениями и специфическими задачами. В частности, DiffusionNFT предлагает эффективную RL-структуру прямого процесса, не требующую траекторий обратного процесса или оценки правдоподобия. Однако применение таких RL-методов к MeanFlow остается малоизученным. DiffusionNFT оптимизирует мгновенные скорости, тогда как MeanFlow осуществляет выборку со средними скоростями. Чтобы преодолеть этот разрыв, мы представляем MeanFlowNFT. Вдохновляясь тождеством MeanFlow, связывающим средние и мгновенные скорости, мы конструируем индуцированный предиктор мгновенной скорости. Применяя целевую функцию DiffusionNFT к этому предиктору, мы делаем оптимизацию вознаграждения корректно определенной для MeanFlow. Выборка по-прежнему основана на средней скорости, что сохраняет быструю многошаговую генерацию MeanFlow. Мы также доказываем, что MeanFlowNFT наследует гарантию строгого улучшения политики от DiffusionNFT. Эксперименты по генерации изображений и видео показывают, что MeanFlowNFT последовательно улучшает базовые модели. Более того, он превосходит предыдущие современные RL-настроенные генераторы с малым числом шагов по большинству метрик (6 из 8 на SD3.5-M) и может даже превзойти многошаговые RL-настроенные диффузионные модели, используя лишь несколько шагов выборки. Например, на Wan 2.1 4-шаговый MeanFlowNFT достигает оценки VBench 84.33, превосходя 50-шаговый LongCat-Video RL (82.57).
Модели генерации музыки на основе фундаментальных подходов в последнее время привлекают значительное внимание промышленности. Однако достижение эффективной генерации и высококачественного длительного аудио с сохранением возможности управления остаётся сложной задачей. Для удовлетворения этих потребностей мы представляем WanSong — простой, но мощный подход к генерации длительных коммерческих песен. В отличие от авторегрессивных (AR) и каскадных многоэтапных конвейеров (например, AR с последующей диффузией), WanSong представляет собой модель, основанную исключительно на диффузии, которая напрямую генерирует высококачественные многоязычные песни продолжительностью до 5 минут и выводит двойные дорожки (вокал и фоновая музыка) за один проход. Кроме того, наша диффузионная структура позволяет ускорить вывод за счёт дистилляции шагов и предлагает эффективный путь для тонкой настройки и кастомизации для поддержки последующих задач редактирования.
Циклические трансформеры масштабируют последовательные вычисления путем применения компактного набора физических блоков в течение нескольких раундов, увеличивая развернутую глубину без увеличения числа хранимых параметров. Такое повторное использование изменяет задачу масштабирования остаточных связей: в трансформере без разделения весов каждая остаточная ветвь получает и применяет собственное обновление параметров, тогда как в циклическом трансформере одно общее обновление агрегирует градиенты от повторных прохождений и считывается теми же прохождениями на следующем линеаризованном прямом проходе. Мы формализуем этот эффект связанной глубины с помощью границы первого порядка возмущений, контролируемой коэффициентом выравнивания прохождений κ_R. Эта граница восстанавливает показатель степени DeepNorm, когда прохождения декоррелированы, но в консервативном согласованном режиме требует увеличения показателя с 1/4 до 1/2 при росте числа циклов при фиксированной физической глубине. Результирующий метод DeepLoop сохраняет архитектуру Post-LN DeepNorm и устанавливает α=(2N)^{1/2} и β=(8N)^{-1/2} для развернутой глубины N. На циклических языковых моделях типа GPT масштаба GPT-2 small и GPT-2 medium DeepLoop нейтрален, когда физический блок не посещается повторно, и улучшает значение функции потерь на валидации и точность нисходящих задач после активации рекуррентной глубины. Эти результаты показывают, что стабильная рекуррентная глубина требует правил масштабирования остаточных связей, учитывающих обращения к параметрам, а не только номинальное число слоев.
Люди с нарушениями зрения (ЛНЗ) ежедневно сталкиваются с серьёзными трудностями из-за ограниченного доступа к визуальной информации. Хотя мультимодальные большие языковые модели (МБЯМ) достигли впечатляющих результатов в общих задачах на понимание изображений и языка, их практическая применимость в реальной помощи слепым остаётся в значительной степени неизученной. Для заполнения этого пробела мы представляем VIABench — комплексный видеобенчмарк, специально разработанный для оценки МБЯМ в сценариях помощи слабовидящим на основе видеороликов от первого лица, записанных или предоставленных самими ЛНЗ. VIABench определяет три ключевые задачи, каждая из которых нацелена на отдельное требование в визуальной помощи: «Упреждающее напоминание» (Proactive Reminder) — оценивает способность модели интерпретировать текущее видео и одновременно предвосхищать и словесно описывать навигационно-критические события; «Визуальный ответ на вопросы» (Visual Question Answering, VQA) — оценивает способность модели отвечать на задаваемые пользователем вопросы об окружении или объектах на видео; «Взаимодействие, направляемое зрением» (Vision-Guided Interaction) — проверяет контекстно-зависимые рассуждения для осуществления целенаправленных взаимодействий между пользователем и средой. Для обеспечения надёжной и справедливой оценки мы предлагаем строгий конвейер бенчмаркинга, поддерживающий как онлайн-режим (в реальном времени), так и офлайн-режим. Наши эксперименты показывают, что современные МБЯМ всё ещё неспособны обеспечить всестороннюю поддержку ЛНЗ, особенно в задаче «Упреждающее напоминание», которая требует точного предвидения и оперативности в реальном времени. Мы надеемся, что VIABench стимулирует будущие исследования в направлении разработки специализированных МБЯМ для практической помощи, что в конечном итоге улучшит опыт навигации и взаимодействия для людей с нарушениями зрения. Код и данные будут опубликованы по адресу https://github.com/MCG-NJU/VIABench.
Мы сообщаем о способе одновременного повышения производительности и радикального снижения стоимости замороженной небольшой языковой модели без изменения каких-либо весов. Верифицированное знание однократно сохраняется в виде побайтно точного артефакта состояния «ключ-значение» (KV), а затем восстанавливается путем прививки в новый контекст инференса. Восстановление является побитно точным: при фиксированной детерминированной конфигурации привитые логиты побайтно идентичны новым вычислениям (равенство SHA-256) с нулевой расходимостью KL и 100% совпадением по argmax на пятидесяти выборках. Мы показываем, что прививка на собственную позицию является единственной численно точной рабочей точкой для модели с роторным кодированием с плавающей точкой, и мы проверяем побайтную точность на двух масштабах модели (12B, 31B) и двух целевых GPU, причем один из них — через предварительно зарегистрированный повтор. На AIME 2025 замороженная Gemma-4-12B переходит с 80.0% на 93.3% после прививки библиотеки верифицированных решений, что превышает ее собственный опубликованный ориентир 77.5% и ориентир ее 31B-аналога 89.2%. В повторяющемся случае восемь задач, которые базовая модель никогда не решает в рамках бюджета в 401 026 токенов, решаются из кэшированных верифицированных решений всего за 61 токен декодирования, что в 6 574 раза меньше токенов и примерно в 8 700 раз меньше энергии; собственно заявление о возможностях основывается на переносе на отложенных данных (7 из 7 на 31B). То же побайтно точное хранилище расширяет используемый контекст с 32 768 до 2 854 766 токенов без дополнительной памяти ускорителя и переносится побайтно идентично между машинами одной архитектуры. Мы описываем систему на уровне поведения; движок является проприетарным, и каждое приведенное число подкреплено зафиксированными хешами входных и выходных данных, чтобы оценку можно было перепроверить без него.
Обучение в контексте обычно интерпретируется как форма условного вывода, в которой подсказка задаёт контекст, а выход модели рассматривается как оценка соответствующего условного распределения. Если эта интерпретация верна, то оценки LLM должны удовлетворять базовым вероятностным тождествам. В частности, закон полной вероятности утверждает, что взвешенные априорными весами условные распределения агрегируются в маргинальные распределения на уровне популяции для любого допустимого разбиения этой популяции. В данной работе мы исследуем, в какой степени оценки LLM соблюдают этот принцип самосогласованности. Мы используем бинарные деревья в качестве оценочного каркаса для рекурсивного разбиения популяции на всё более мелкозернистые подпопуляции. Затем мы подаём LLM вербализованные описания подпопуляций в контексте, агрегируем полученные оценки обратно в оценки на уровне популяции и сравниваем их для разбиений различной степени детализации. Применяя этот протокол к разным предметным областям и современным передовым моделям, мы демонстрируем повсеместные нарушения базовых свойств согласованности. Углублённое исследование промптинга с указанием персоны выявляет закономерность, которую мы называем макро-заблуждением: оценки, восстановленные из ответов более мелкозернистых подпопуляций, часто лучше согласуются с эталонными данными человека, чем прямые оценки на уровне популяции. Этот эффект сохраняется при варьировании структуры дерева и задачи оценивания и может быть частично восстановлен с помощью неявного промптинга. В совокупности эти результаты позволяют предположить, что модели обладают соответствующими знаниями о подпопуляциях, но не надежно переносят их в агрегированные оценки. Этот разрыв устанавливает статистическую самосогласованность как ненасыщенный критерий без привлечения эталонов для оценки LLM.
Недавние обобщаемые модели 3D-гауссова всплеска продвинули синтез новых видов (NVS) для длинных последовательностей, однако ценой значительных избыточных вычислений. Мы выявили, что избыточность можно уменьшить, исходя из двух наблюдений: (i) геометрия высокой точности не является строго обязательной для качественного NVS; (ii) обучение внешнему виду в целом проще, чем восстановление геометрии. Руководствуясь этими соображениями, мы предлагаем асимметричную архитектуру, разделяющую моделирование геометрии и внешнего вида. Ветвь геометрии обрабатывает токены грубой зернистости, используя большую часть параметров для многовидовой реконструкции, в то время как ветвь внешнего вида работает с токенами мелкой зернистости, фиксируя детали при значительно меньшем числе параметров. Две ветви взаимодействуют через двусторонние связи, обеспечивая взаимное направление для своих задач. Такая осведомленная о задаче асимметрия снижает вычислительную избыточность и более рационально распределяет вычисления, тем самым повышая эффективность параметров и позволяя меньшим моделям достигать высокой производительности. На входных данных 32 вида при разрешении 960P наша модель сравнима с методами, основанными на оптимизации, обеспечивая при этом ускорение почти в 800 раз, и превосходит производительность в режиме zero-shot современных обобщаемых моделей при заметно меньшем числе параметров и сниженных вычислительных затратах на обучение и инференс, что в целом повышает эффективность.
Агентная генерация с дополнением поиска (RAG) расширяет статический RAG, позволяя языковым моделям итеративно рассуждать, генерировать поисковые запросы, извлекать свидетельства и предсказывать ответы. Однако моделям по-прежнему сложно решать, когда выполнять поиск, использовать ли лексическое соответствие или семантическое сходство, а также контролировать гранулярность контекста, чтобы избежать помех от нерелевантных токенов в процессе рассуждений агента. В данной статье мы представляем GRASP — фреймворк обучения с подкреплением (RL) для тренировки агентов, способных адаптивно координировать взаимодополняющие инструменты поиска в ходе многошаговых рассуждений. GRASP предоставляет агенту действия семантического поиска, поиска по ключевым словам и чтения абзацев, что позволяет ему извлекать свидетельства на уровне предложений и расширять контекст только при необходимости. Мы обучаем политику с вознаграждением, которое совместно учитывает точность ответа, обоснованное чтение, взаимодополняющий поиск и эффективность шагов. Эксперименты на эталонах многошаговых рассуждений показывают, что GRASP улучшает как полноту поиска, так и производительность нисходящего ответа на вопросы по сравнению с одношаговым поиском, подсказочным агентным RAG и базовыми методами поиска на основе RL. Качественный анализ и анализ абляций показывают, что изученная политика развивает интерпретируемое поведение беглого просмотра и сканирования: она использует семантический поиск для широкого исследования, чтение абзацев для локальной проверки и поиск по ключевым словам для обнаружения свидетельств, специфичных для сущностей. Эти результаты позволяют предположить, что обучение координации сигналов поиска и гранулярности контекста критически важно для правильных рассуждений агента.
Воплощенное познание требует, чтобы агенты связывали высокоуровневое рассуждение о задачах с достижимыми физическими состояниями. Мы представляем Hy-Embodied-RxBrain — фундаментальную модель воплощенного познания, обладающую совместным языково-визуальным рассуждением и воображением. В отличие от моделей зрения-языка, делающих акцент на понимании сцены и текстовом принятии решений, или генеративных моделей мира, которые в основном предсказывают будущие визуальные состояния, RxBrain представляет воплощенные планы в единой последовательности планирования, где язык и визуальное воображение играют взаимодополняющие роли. Язык обеспечивает абстрактную структуру плана, включая декомпозицию задачи, примитивы планирования, ограничения, временной порядок и логику принятия решений, тогда как визуальное воображение обосновывает эту структуру через предсказание состояния мира и совместное планирование подцелей, связывая каждый шаг планирования с промежуточными и конечными физическими состояниями. RxBrain использует унифицированную мультимодальную архитектуру Mixture-of-Transformers, которая поддерживает понимание и генерацию языка, изображений и видео в рамках одной модели. Для обучения этой способности мы создаем автоматический конвейер, который преобразует воплощенные видео в совместное текстово-визуальное обучение планированию, разбивая видео на шаги планирования и выравнивая их с переходами визуальных состояний. Кроме того, мы представляем RxBrain-Bench для оценки того, могут ли модели представлять воплощенные планы через совместные текстовые и визуальные компоненты, а не через раздельное понимание или генерацию. Эксперименты показывают, что RxBrain сохраняет способности к воплощенному пониманию и генерации, а также создает планы с объединенным текстовым рассуждением, предсказанием состояния мира и совместным планированием подцелей. Мы также расширяем RxBrain на генерацию непрерывных действий робота, где он демонстрирует многообещающую производительность на реальном роботе без предварительного обучения на крупномасштабных данных о действиях. Эти результаты представляют собой начальный шаг к созданию фундаментальных моделей для воплощенного познания.
Выравнивание CAD-изображений направлено на оценку 9D-позы объекта (вращение, перемещение и анизотропный масштаб) по одному RGB-изображению, что находит применение в робототехнике и дополненной реальности. Современные методы без обучения (zero-shot) используют модели визуального основания для сопоставления областей изображения с CAD-моделями, однако их соответствия, как правило, управляются внешним видом и деградируют при окклюзии или переходе от симуляции к реальности. Для преодоления этих ограничений мы представляем SUFLECA (Scaling Up Feature LEarning for CAD Alignment) — слабо контролируемую структуру для выравнивания CAD без обучения с двумя ключевыми вкладами. Во-первых, SUFLECA масштабирует обучение признаков, основанных на геометрии, из предварительно обученных визуальных представлений с помощью супервизии нормализованных координат объекта (NOCs) на 674 000 изображений из 12 реальных и синтетических наборов данных, изучая компактные геометрически осведомленные признаки, обобщаемые между доменами. Во-вторых, мы предлагаем геометрически согласованный алгоритм сопоставления, устанавливающий надежные взаимно-однозначные соответствия CAD-изображения. Совместно эти вклады обеспечивают точное выравнивание за доли секунды для каждого экземпляра объекта без итеративного уточнения позы. На наборе данных ScanNet25k SUFLECA достигает точности 33.4%/42.3% для категорий/экземпляров, превосходя (при меньшей вычислительной нагрузке) сильнейший базовый метод без обучения на 10.3/12.2 процентных пункта и впервые на этом эталоне даже превосходя полностью контролируемые методы. Код доступен по адресу: https://github.com/snt-arg/SUFLECA
Видеомодели эволюционируют в фундаментальные модели зрения, однако им по-прежнему не хватает многошаговых рассуждений, свойственных человеку. Потоковые авторегрессионные диффузионные модели эффективны, но ограничены в способности к рассуждению, в то время как двунаправленная диффузия обеспечивает глобальное пересмотрение, но требует высоких вычислительных затрат на инференс из-за плотного покадрового шумоподавления. Обе парадигмы не способны достичь логической согласованности и низкой задержки при потоковой обработке для сложных задач рассуждения. Мы предлагаем HDR (Иерархическое Шумоподавление для Визуального Рассуждения) — унифицированную структуру, интегрирующую иерархические скрытые переменные в каузальную генерацию видео для многошаговых рассуждений. HDR организует скрытые переменные видео в древовидную иерархию, обеспечивая рассуждение от общего к частному перед потоковым выводом. Грубые слои шумоподавления сохраняют неопределенные гипотезы для глобального планирования, в то время как более тонкие слои постепенно уточняют их до конкретных визуальных состояний. Разреженный иерархический паттерн внимания (РИПВ) дополнительно снижает затраты на временное внимание. Мы вводим стратифицированный по уровням бенчмарк для многошаговых видеорассуждений с случаями вне распределения, охватывающий шесть задач: навигация в лабиринте, Ханойская башня, рисование одной линией, игра в пятнашки, Сокобан и переливание воды. По сравнению с потоковыми авторегрессионными диффузионными базовыми моделями, HDR повышает успешность с 34,22 до 60,29 (относительный прирост 76,2%) и увеличивает средний прогресс с 76,00 до 89,56, демонстрируя более согласованные траектории рассуждения. HDR поддерживает потоковую передачу с низкой задержкой — 0,70 секунды на скрытую переменную, что обеспечивает в 54,2 раза более быстрый инференс по сравнению с двунаправленной диффузией. При использовании только 2% обучающих данных HDR сохраняет 82,9% производительности от полного набора данных, тогда как двунаправленная диффузия — лишь 52,0%. Эксперименты с реальными роботами дополнительно демонстрируют потенциал HDR для физического взаимодействия и моделирования мира. Демонстрация проекта: https://hierarchical-diffusion-reasoning.github.io/.
Валидация автономных систем вождения требует разнообразных, соответствующих нормативным требованиям тестовых сценариев. В тестировании на основе симуляции сценарии определяются как исполняемые скрипты. Однако автоматическая генерация таких скриптов из описаний нормативных требований остается открытой задачей, а существующие подходы сталкиваются с фундаментальными компромиссами. Методы извлечения и сборки достигают приемлемых показателей компиляции, но не обладают масштабируемостью, в то время как генерация полного сценария на основе извлечения страдает низкой успешностью компиляции. Мы представляем Chat2Scenic — первую итеративную платформу с дополнением извлечения для генерации скриптов сценариев на предметно-ориентированном языке (DSL). В частности, Chat2Scenic предоставляет интерфейс чат-бота, поддерживающий интерактивное уточнение сценариев, и интегрирует генерацию с дополнением извлечения (RAG) для обоснования генерации сценариев на основе нормативных знаний и синтаксиса DSL. Кроме того, мы предлагаем открытый эталонный набор для генерации сценариев, включающий 123 сценария из различных нормативных документов, в том числе NHTSA и Правил ООН по транспортным средствам, а также других источников. Обширная оценка с использованием современных больших языковых моделей (LLM) показывает, что Chat2Scenic достигает 76,42% процента успешной компиляции (CSR) и 58,17% точности платформы (FA), превосходя существующие методы (извлечение и сборка: 30,08% CSR, 11,03% FA; генерация полного сценария на основе извлечения: 16,26% CSR, 10,86% FA). Для содействия будущим исследованиям мы публикуем наш код в открытом доступе по адресу https://github.com/TUM-AVS/chat2scenic.
В данной статье мы представляем модель непрерывной диффузии с временными метками токенов (token time continuous diffusion, TTCD) — новую диффузионную языковую модель, которая (а) работает в непрерывном пространстве, детерминированно отображая гауссовский шум в конечное полотно токенов без дополнительной выборки, и, что важно, (б) включает новую концепцию индивидуальных времен для каждого токена, при которой некоторые токены переходят от шума к токену с более высокой скоростью, чем другие. Моделирование в непрерывном пространстве помогает TTCD избежать параллельной выборки нескольких токенов, что является ключевым источником неточности при высоком ускорении для моделей, работающих исключительно в дискретном пространстве. Концепция индивидуальных времен токенов позволяет TTCD лучше моделировать условную генерацию, обеспечивает более высокую скорость для более уверенных токенов и позволяет дифференцировать взаимные влияния токенов в процессе уточнения. TTCD превосходит дискретные модели при высоком ускорении. Мы обучаем модель TTCD с 160 млн параметров на наборе данных OpenWebText, а затем применяем к ней самодистилляцию; обнаруживается, что при высоком ускорении мы сопоставимы по качеству безусловной генерации и превосходим по качеству условной генерации несколько существующих моделей аналогичного размера, обученных на тех же данных и подвергнутых самодистилляции. Аналогичные улучшения достигаются и в решении судоку.