Ежедневно отобранные исследовательские статьи по ИИ с переводами
Роботизированное манипулирование в открытом мире требует не только распознавания внешнего вида сцены, но и предвидения того, как ее трехмерная структура изменяется при взаимодействии. Мы утверждаем, что синхронизированные RGB, глубина и оптический поток, а именно RGB-DF, обеспечивают физически обоснованное представление, которое отражает нижележащую 4D-динамику сцены. По сравнению с 2D-пиксельными видео, эта мультимодальная синергия согласует визуальный облик с геометрической структурой и временным движением, создавая пространство представления, значительно более близкое к низкоуровневым действиям конечного исполнителя, требуемым робототехническими системами, тем самым сокращая разрыв между предсказанием мира и обучением политике. Основываясь на этом понимании, мы представляем RynnWorld-4D — генеративную модель, которая в рамках единого процесса диффузии совместно производит будущие RGB-кадры, карты глубины и оптический поток на основе одного RGB-D изображения и текстовой инструкции. Эта 4D-модель мира содержит архитектуру с тремя ветвями, которая интегрирует межмодальное внимание с покадровой 3D-позицией RoPE, обеспечивая согласованную эволюцию облика, геометрии и движения. Для обеспечения данных для обучения в масштабе мы подготовили Rynn4DDataset 1.0 — обширный набор данных, включающий более 254.4 миллионов кадров из эгоцентрических видео с участием человека и роботов, со высококачественными псевдометками глубины и оптического потока. Мы также предлагаем RynnWorld-4D-Policy — головку обратной динамики, которая потребляет внутренние 4D-представления RynnWorld-4D за один прямой проход, обходя дорогостоящее многошаговое шумоподавление, чтобы выдавать действия робота в режиме замкнутого цикла. Эксперименты показывают, что RynnWorld-4D создает темпорально и пространственно согласованные 4D-предсказания, а RynnWorld-4D-Policy достигает передовой производительности в реальных задачах ловкого двуручного манипулирования, особенно преуспевая в задачах, требующих пространственной точности и временной координации.
Игровые миры традиционно создавались с помощью трудоемких производственных конвейеров, что делало их дорогими в разработке, сложными в настройке и требующими значительных затрат на модификацию после развертывания. Недавние достижения в области видеомировых моделей предлагают принципиально иную парадигму. Вместо явного описания каждого компонента виртуальной среды такие модели авторегрессивно синтезируют будущие наблюдения, обусловленные текущим состоянием мира и действиями пользователя, что позволяет генерировать игровые миры в режиме онлайн. Обучаясь как на записях игрового процесса, так и на видео реального мира, они способны улавливать разнообразные визуальные образы и физическую динамику, открывая новые возможности для интерактивных приложений за пределами игр, включая воплощенный интеллект. В данной статье мы представляем AlayaWorld — полностековую платформу с открытым исходным кодом для построения интерактивных генеративных миров. AlayaWorld обеспечивает открытое взаимодействие в реальном времени, позволяя пользователям свободно перемещаться и выполнять разнообразные действия, такие как сражения, наложение заклинаний и призыв монстров. Платформа объединяет полный цикл разработки — от подготовки данных, архитектуры модели, обучения модели, ускорения инференса до развертывания — в рамках модульной и расширяемой архитектуры. Вместе с платформой мы предоставляем воспроизводимые пайплайны, эталонные реализации, инструменты оценки и исчерпывающую документацию, закладывая практическую основу для будущих исследований и приложений генеративных мировых моделей в реальном времени.
Масштабирование обучения роботов требует огромных и разнообразных наборов данных траекторий, однако в настоящее время их сбор ограничен физической телеоперацией, при которой каждая демонстрация привязывает время оператора к конкретному оборудованию и рабочим пространствам. Мы представляем цифровую телеоперацию — парадигму, которая устраняет зависимость сбора данных от физических ограничений, заменяя реального робота генеративной моделью мира. В этом подходе поток жестов руки оператора управляет роботоцентрической генеративной моделью мира, синтезирующей высококачественные эгоцентрические видео на основе одного эталонного изображения. Записанный поток жестов служит меткой действия, независимой от воплощения (embodiment-agnostic) и переносимой на любого целевого робота с помощью стандартного ретаргетинга, что даёт полные траектории «состояние-действие» для обучения имитации без привязки к физическому оборудованию. Мы реализуем эту парадигму в системе RynnWorld-Teleop, которая объединяет скелетное кондиционирование с учётом глубины, прогрессивное обучение типа «человек-робот» на видеотрансформере диффузии и потоковую авторегрессионную дистилляцию. Этот конвейер сжимает генеративный процесс в однопроходный вывод, обеспечивая интерактивную генерацию в реальном времени на одном графическом процессоре H100 с частотой более 40 кадров в секунду. Политики, обученные исключительно на данных, сгенерированных RynnWorld-Teleop, достигают эффективного нулевого переноса из симуляции в реальность (zero-shot Sim2Real) для разнообразных двуручных задач, требующих ловкости. Более того, дополнение наборов реальных данных нашими цифровыми телеоперационными данными последовательно повышает показатели успешности, что демонстрирует, что RynnWorld-Teleop служит высококачественным, масштабируемым механизмом генерации данных для следующего поколения роботизированных агентов.
Масштабирование современных больших языковых моделей (LLM) до длинных контекстов ограничено квадратичной вычислительной стоимостью и плохой экстраполяцией длины плотного внимания. Блочно-разреженное внимание предлагает многообещающую альтернативу, но все существующие методы уступают полному вниманию из-за неточного отбора блоков. Мы предлагаем иерархическое разреженное внимание с ориентирами (HiLS-Attention) — механизм блочно-разреженного внимания, который обучает отбор блоков сквозным образом с помощью функции потерь языковой модели (LM). HiLS иерархически факторизует внимание: каждый запрос независимо выполняет внимание с каждым извлечённым блоком для получения специфичной для блока информации, а результирующие выходы объединяются в соответствии с оценками извлечения блоков. Включая оценки извлечения в прямой проход вычислений внимания, HiLS оптимизирует их непосредственно с помощью потерь LM, что позволяет реализовать сквозное обучение извлечению и естественное разреженное обучение. Экспериментальные результаты показывают, что HiLS-Attention достигает производительности, сопоставимой, а в некоторых случаях и превосходящей полное внимание, на длинах контекстов внутри домена. В то же время HiLS-Attention экстраполирует длину контекста более чем в 64 раза относительно длины обучения с 90% точностью извлечения, далеко превосходя полное внимание. Кроме того, существующие модели полного внимания могут быть преобразованы в HiLS-Attention путём лёгкого продолженного предобучения, сохраняя производительность внутри домена и приобретая способность к сверхдлинной контекстной экстраполяции. В сочетании с разреженным доступом к KV и вычислениями HiLS-Attention нарушает обычный компромисс между эффективностью и производительностью, обеспечивая LLM с длинным контекстом, которые одновременно более эффективны и более результативны в общих задачах с длинным контекстом по сравнению с аналогами, использующими полное внимание.
Мы формулируем компьютерное зрение как унифицированную мультимодальную генерацию, где разнородные визуальные задачи выражаются в пространствах генерации текста и изображений единой мультимодальной модели без использования специализированных архитектур для конкретных задач. В рамках этой формулировки SenseNova-Vision использует инструкции на естественном языке и опциональные визуальные подсказки для определения задач, целевых областей или видов, а также соглашений о декодировании, и генерирует ответы в виде текста для символьных выходов, изображений для плотных пространственных предсказаний или смешанных текстово-изображенческих выходов для композиционных задач. Для поддержки крупномасштабного обучения мы преобразуем разнообразные аннотации компьютерного зрения в примеры формата «инструкция-ответ», совместимые с этими пространствами генерации, что приводит к созданию SenseNova-Vision Corpus — корпуса инструкций-ответов по компьютерному зрению, охватывающего текстовые, изображенческие и смешанные целевые выходы. Начиная с готовой предварительно обученной унифицированной мультимодальной модели, SenseNova-Vision обучается в основном на этом корпусе с использованием вспомогательных мультимодальных данных как смеси, сохраняющей способности; при этом не требуются прогностические головки или архитектурные модификации для конкретных задач. Полученная модель охватывает широкий спектр задач компьютерного зрения, включая детекцию, OCR, оценку ключевых точек, сегментацию, оценку глубины, предсказание нормалей поверхности, карты точек и оценку позы камеры, а также поддерживает варианты, определяемые языком, которые комбинируют категорию, цвет, область и другие визуальные подсказки. Эксперименты показывают, что единая модель может соответствовать ведущим специализированным системам в задачах структурированного визуального понимания, плотного геометрического предсказания, сегментации и многовидовой визуальной геометрии. Эти результаты указывают на то, что унифицированная мультимодальная генерация является масштабируемым путём для интеграции возможностей компьютерного зрения в фундаментальные модели общего назначения. Модель и корпус доступны публично.
Мы представляем Gemma 4, новое поколение языковых моделей с открытыми весами, нативно мультимодальных, в семействе моделей Gemma. Разработанный для повышения вычислительной эффективности и способности к рассуждению, набор моделей Gemma 4 включает плотные архитектуры и архитектуры типа «смесь экспертов» с количеством параметров от 2,3 до 31 миллиарда. Наряду с улучшенными энкодерами для изображений и аудио для всех размеров моделей, мы предлагаем унифицированную архитектуру без энкодера для нашей 12B модели, которая обрабатывает необработанные аудиоданные и патчи изображений. Кроме того, мы интегрируем режим рассуждения, позволяющий моделям Gemma генерировать цепочки рассуждений перед ответом. Мы улучшаем скорость инференса, эффективность использования памяти и вычислений, а также способность работать с длинными контекстами с помощью критически важных проектных решений. Gemma 4 совершает скачок в производительности на бенчмарках STEM, мультимодальных и длинноконтекстных, и конкурирует с более крупными передовыми открытыми моделями в задачах с оценкой человека.
Агентное понимание видео наделяет модели долговременной памятью для автономной обработки и реагирования на непрерывные, длительные мультимодальные потоки. Однако продвинутые видеоагенты часто полагаются на «детективное» итеративное рассуждение для управления действиями (например, поиск) и агрегации свидетельств, что влечет за собой непомерные затраты и задержки. Мы утверждаем, что такое тяжелое рассуждение в основном компенсирует отсутствие глобального контекста и семантическое рассогласование при поиске. В этой статье представлен Light-Omni — мультимодальный агентный фреймворк для рефлексивного и легковесного понимания видео. Это достигается за счет двойных контекстуальных состояний, которые мгновенно формируют необходимый контекст за один прямой проход. Во-первых, мы поддерживаем глобальное состояние — конечный мультимодальный сценарий, непрерывно консолидируемый из эпизодической памяти, служащий глобальным контекстом для Light-Omni. Посредством иерархического слияния он сохраняет недавние детали, одновременно обобщая прошлые события. Во-вторых, на основе этого глобального контекста мы генерируем параметрическое латентное состояние, которое напрямую управляет автономными действиями и создает эмбеддинги для поиска с минимальной задержкой. Благодаря такой связанной конструкции Light-Omni достигает семантически согласованного поиска и рефлексивных ответов, избегая итеративного рассуждения. Обширные эксперименты подтверждают эффективность Light-Omni на нескольких видео-бенчмарках. Примечательно, что он превосходит M3-Agent со средним приростом точности на 2,4%, ускорением в 12,1 раза и улучшением эффективности использования памяти GPU в 2,6 раза. Кроме того, он служит системой памяти, повышающей как производительность, так и эффективность существующих MLLM. Страница проекта: https://clare-nie.github.io/Light-Omni.
Спекулятивное декодирование ускоряет инференцию больших языковых моделей (LLM) за счет разделения генерации черновиков и верификации целей. Хотя современные параллельные генераторы черновиков эффективно предлагают длинные токеновые последовательности за один прямой проход, они страдают от быстрого ухудшения принятия из-за отсутствия межтокенных зависимостей. Более того, неизбирательная верификация этих расширенных блоков расходует критическую пропускную способность пакетной обработки на токены с высоким риском отклонения, что резко ухудшает пропускную способность в системах с высокой конкурентностью запросов. Мы представляем DSpark — фреймворк спекулятивного декодирования, объединяющий высокопроизводительную параллельную генерацию с адаптивной верификацией, учитывающей нагрузку. Для поддержания качества черновиков DSpark использует полуавторегрессионную архитектуру, сочетающую параллельный базовый модуль с легковесным последовательным модулем, что обеспечивает моделирование внутриблочных зависимостей и снижает ухудшение суффикса. Для оптимизации эффективности системы DSpark применяет верификацию с планированием на основе уровня уверенности, динамически подбирая длину верификации для каждого запроса в зависимости от предполагаемых вероятностей выживания префикса и профилей пропускной способности конкретного движка. На автономных бенчмарках из различных доменов DSpark существенно улучшает принятую длину по сравнению с современными авторегрессионными и параллельными генераторами черновиков. При развертывании в системе обслуживания DeepSeek-V4 в условиях реального пользовательского трафика DSpark успешно снижает потери на верификацию. По сравнению с установленным производственным базовым уровнем (MTP-1), DSpark ускоряет генерацию для каждого пользователя на 60–85 процентов при одинаковых уровнях пропускной способности. Более важно, что, предотвращая серьезное снижение пропускной способности при строгих ограничениях интерактивности, DSpark обеспечивает уровни производительности, ранее недостижимые, смещая границу Парето нашей системы обслуживания.
Хотя оптимизация навыков для автономных агентов привлекла внимание, существующие методы опираются на сложные конвейеры. Это оставляет без ответа фундаментальный вопрос: что составляет минимально жизнеспособный конвейер для оптимизации навыков, где каждый компонент обоснован теорией или эмпирической необходимостью? Мы формализуем оптимизацию навыков с помощью оптимизации нулевого порядка (ZO), сопоставляя классические аналоги (центральная разность, доверительные области) с недавней литературой. Отмечая, что в отличие от слепых численных возмущений в классической ZO, траектории навыков служат интерпретируемой отладочной обратной связью. Основываясь на философии Claude Code и PAC-обучении, мы устанавливаем три принципа сходимости и обобщения: исследование траекторий на основе файловой системы, анализ консенсусных атрибутов и независимый валидационный шлюз. Устраняя избыточность, мы предлагаем SkillOpt-Lite. Он ускоряет сходимость и превосходит полный SkillOpt: улучшая LiveMath на +8.8 баллов на GPT-5.5 и на +25.4 балла на GPT-5.4-nano, позволяя nano-модели превзойти стандартный GPT-5.4, оптимизированный с помощью SkillOpt. Наконец, мы интегрируем наш фреймворк в продукционные кодирующие агенты, такие как VSCode Copilot, позволяя разработчикам эволюционировать навыки агентов одной строкой кода. Поскольку наш фреймворк рассматривает все компоненты агента просто как стандартный редактируемый код, этот минимальный конвейер естественным образом обобщается до оптимизации полного окружения (HarnessOpt). На SpreadsheetBench HarnessOpt позволяет GPT-5.4-nano достичь точности 0.7758, превзойдя более крупный GPT-5.5, работающий на стандартных конвейерах (0.7620). Код доступен по адресу https://github.com/EvolvingLMMs-Lab/SkillOpt-Lite.
Плотное видеоаннотирование направлено на генерацию временно привязанных описаний видеособытий, что полезно как для понимания видео на уровне событий, так и для их генерации. В этой области авторегрессионные большие языковые модели для видео стали распространенной парадигмой благодаря их высокой генеративной способности и способности к кросс-модальному моделированию. Однако генерация плотных аннотаций в парадигме «токен за токеном» значительно снижает эффективность вывода и ограничивает масштабируемость по мере увеличения длины видео и плотности событий. В данной работе мы предлагаем параллелизованную авторегрессионную структуру, которая не только повышает эффективность генерации, но и улучшает производительность временно привязанного аннотирования. Ключевая идея заключается в использовании слабых локальных зависимостей между временно различными событиями для перестройки графа причинно-следственных зависимостей, что позволяет осуществлять без потерь параллельную генерацию. В частности, токены со слабыми кросс-событийными зависимостями могут декодироваться параллельно, тогда как тесно связанные токены внутри каждого события сохраняют последовательное декодирование для поддержания локальной семантической согласованности. Для реализации этой идеи мы вводим два ключевых компонента для без потерь параллельного декодирования: (1) латентный механизм глобального планирования, который автоматически изучает структуру на уровне событий и генерирует компактные токены, кодирующие глобальную причинно-следственную связь между событиями, при этом адаптивно агрегируя аудиовизуальную семантику на уровне событий, направляя последующую перестройку зависимостей и параллельное декодирование; и (2) механизм параллельного декодирования с факторизацией событий, который эффективно балансирует локальное внимание с глобальной осведомленностью о межсобытийных связях. Эксперименты на различных эталонах демонстрируют явное преимущество нашего подхода как в эффективности, так и в производительности при омнимодальном привязывании событий и аннотировании. Веб-сайт проекта: https://github.com/showlab/PadCaptioner.
Несмотря на недавние успехи в создании фундаментальных моделей VLA, разрыв между лабораторными условиями и реальными приложениями продолжает препятствовать их практическому внедрению. Для преодоления этого разрыва мы представляем LingBot-VLA 2.0, который развивает LingBot-VLA за счет улучшений в трех функциональных областях. (1) Обобщение на различные задачи и воплощения. По сравнению с предыдущей версией, мы переработали конвейер обработки данных и собрали около 60 000 часов данных для предварительного обучения, включая 50 000 часов траекторий роботов, охватывающих 20 конфигураций роботов, и 10 000 часов эгоцентричных видеозаписей человека. (2) Расширенное пространство действий в дополнение к аппаратным платформам с двумя манипуляторами. В частности, наша система учитывает степени свободы голов, корпусов, мобильных баз и ловких рук, что позволяет роботам решать более сложные задачи в практических сценариях. (3) Прогностическое моделирование динамики для улучшения временного рассуждения. В частности, мы формулируем предсказание будущего как прокси-задачу, облегчаемую моделью представления видео для семантических априорных знаний и моделью оценки глубины для геометрических подсказок. Оценки на тестовом наборе GM-100, проведенные в условиях общего назначения, подтверждают положительное влияние этих предложенных модификаций. Кроме того, благодаря расширенным данным предварительного обучения, охватывающим степени свободы всего тела, LingBot-VLA-2.0 демонстрирует высокую способность к кросс-воплощенной долгосрочной мобильной манипуляции на двух роботизированных платформах.
Дистилляция на политике (OPD) обучает политику студента путем согласования с более сильным учителем на собственных траекториях студента, что представляет собой перспективный фреймворк для обучения языковых агентов. Однако ее применение к долгосрочным агентным задачам остается недостаточно изученным. Мы выявляем две ключевые неэффективности стандартной агентной OPD: (1) прогоны на полном горизонте часто тратят ресурсы реального времени на хвостовые шаги, которые дают слабый и зашумленный KL-надзор, и (2) KL-цели на уровне траектории концентрируют большую часть потерь на поверхностных токенах, оставляя более глубокие шаги принятия решений недообученными после согласования начального поведения. Для решения этих проблем мы предлагаем TurnOPD — стратегию бюджетирования на уровне шагов для эффективной дистилляции на политике долгосрочных агентов. TurnOPD состоит из двух контроллеров бюджета: адаптивного бюджетирования глубины прогонов, которое использует статистику шагов на основе зондов для определения длины прогона, и прогрессивного бюджетирования потерь, нормализованных по шагам, которое постепенно смещает KL-взвешивание с надзора на уровне токенов к сбалансированному по шагам надзору. Эксперименты на ALFWorld, WebShop и Multi-Hop Search с моделями учителей, специализированными под задачу, показывают, что TurnOPD достигает превосходной точности валидации при равных бюджетах обучения в реальном времени и продвигает границу точности-времени за пределы стандартной OPD.
Мы представляем MentalThink — парадигму визуально-символического рассуждения, которая наделяет мультимодальные большие языковые модели (MLLM) исполнимым механизмом «мысленной» визуализации. Основой MentalThink служит конвейер think-with-SVG, в котором модель учится генерировать, отображать и интерпретировать код масштабируемой векторной графики (SVG) в качестве промежуточного визуального представления для многошаговых рассуждений. Создавая структурированные векторные наброски, модель может экстернализировать пространственные гипотезы, проверять их с помощью детерминированной визуализации и рассуждать в рамках ограниченного геометрического пространства, эффективно имитируя человеческий процесс мысленных образов. Мы реализуем эту парадигму с помощью двухэтапной схемы обучения, объединяющей контролируемую тонкую настройку (SFT) для синтаксического согласования SVG с многошаговым обучением с подкреплением (RL), стимулирующим итеративную проверку, пересмотр и уточнение промежуточных визуальных гипотез. Обширные оценки показывают, что MentalThink достигает превосходных результатов в задачах пространственного понимания и рассуждения (например, 55,1% на VSIBench, 76,0% на MindCube), демонстрируя, что исполнимая векторная графика обеспечивает верифицируемое визуальное рабочее пространство для динамического восприятия перспективы, визуальной рефлексии и композиционного построения сцен.
Обучение с подкреплением (RL) для следования инструкциям, не подлежащим верификации, всё чаще опирается на LLM-судьи с рубриками, специфичными для промптов, в качестве сигналов вознаграждения. Хотя современные методы адаптируют эти рубрики к изменяющейся политике в процессе обучения, сами обучающие промпты остаются статичными, берясь из фиксированных корпусов. Такой статический подход часто приводит к критическому несоответствию между сложностью промптов и возможностями политики, в результате чего судья не может восстановить дискриминативный сигнал вознаграждения, когда промпты не вызывают различий в качестве среди развёрток. Для устранения этого несоответствия мы представляем LLM-as-a-Tutor — фреймворк, расширяющий роль LLM от судьи до наставника: одна и та же модель выступает как экзаменатор, попарно сравнивающий развёртки политики для выявления невызывающих трудностей промптов, и как генератор, добавляющий к ним атомарные ограничения. Эта конструкция только с добавлением ограничений монотонно повышает сложность синхронно с возможностями политики, создавая самокалибрующийся обучающий сигнал без внешних графиков сложности. На трёх сложных бенчмарках следования инструкциям наш метод последовательно превосходит как базовые методы, не учитывающие политику, так и предшествующие адаптивные к политике методы, адаптирующие рубрики или переписывающие промпты, что указывает на адаптацию промптов как на недостающую ось учёта политики в не подлежащем верификации RL.
Недавние достижения в области крупномасштабных генеративных моделей существенно продвинули генерацию видео, однако существующие методы по-прежнему ограничены жёсткой парадигмой вывода. Двунаправленные диффузионные модели превосходно обеспечивают глобальную согласованность и визуальное качество, но страдают от медленного вывода, в то время как авторегрессионные модели обеспечивают эффективную и потоковую генерацию за счёт долгосрочной согласованности и смещения экспозиции. Мы представляем Flex-Forcing — унифицированную структуру обучения и вывода, которая позволяет модели диффузии видео бесшовно работать как в двунаправленном, так и в авторегрессионном режимах генерации. Основная идея — гибкий механизм разбиения на блоки, совместно определяемый по временной оси и шагам шумоподавления. Эта конструкция позволяет модели (1) выполнять гибкое разбиение на блоки в соответствии с различными ограничениями по вычислительным ресурсам, (2) выполнять двунаправленный вывод между блоками для планирования глобальной структуры, одновременно генерируя кадры авторегрессионно внутри каждого блока для эффективного и мелкозернистого синтеза, и (3) выполнять авторегрессионную генерацию в произвольном порядке и на произвольном временном шаге без строгого каузального ограничения. Обширные эксперименты на нескольких эталонах генерации видео показывают, что Flex-Forcing достигает неизменно лучшего качества видео, стабильности длинных видео по сравнению с сильными базовыми моделями с жёстким графиком вывода, при этом обеспечивая более быстрый вывод.
Сложное создание и редактирование изображений часто требует более одной модели генерации или редактирования. Запрос пользователя может включать синтез изображений, локализацию объектов, сегментацию областей, редактирование выбранного содержимого, компоновку промежуточных ресурсов, чтение текста и улучшение конечного результата. Такие задачи переводят мультимодальные агенты от рассуждений, дополненных восприятием, к визуальному творчеству, ориентированному на манипуляции, где инструменты должны активно преобразовывать визуальные состояния, а не просто проверять их. Однако существующие мультимодальные агенты, использующие инструменты, в основном оптимизированы для восприятия, поиска или предметно-ориентированного редактирования и не имеют крупномасштабного контроля для исполнимых траекторий создания изображений. В этой статье мы представляем CanvasCraft — крупномасштабный мультимодальный набор данных для использования инструментов при сложном создании и редактировании изображений, а также CanvasAgent — мультимодального агента с расширенными инструментами, который учится координировать разнородные визуальные инструменты посредством многораундового взаимодействия. CanvasCraft содержит 140 тысяч полностью аннотированных исполнимых траекторий и 10 тысяч спецификаций задач для обучения с подкреплением. CanvasAgent сначала обучается с помощью SFT для изучения исполнимых траекторий «рассуждение-действие», а затем оптимизируется с помощью GRPO с использованием гибридного вознаграждения, объединяющего сигналы на уровне результата и процесса. Во время развертывания CanvasAgent проверяет промежуточные результаты, отслеживает визуальные ресурсы и адаптирует решения по инструментам к изменяющемуся визуальному состоянию. Эксперименты оценивают как качество конечного изображения, так и поведение траектории, демонстрируя эффективность CanvasAgent и предложенного набора данных для сложных многокомпонентных рабочих процессов создания изображений.
Проблемы, связанные с генерацией 3D-сцен с эгоцентрической точки зрения, сохраняются из-за ограниченного перекрытия обзоров и доминирующего влияния индивидуальных перспектив на интерпретацию сцены. Эти факторы препятствуют созданию согласованного по точкам обзора и семантически выровненного визуального контента, а также построению точных геометрических структур. В данной работе мы предлагаем CGGS — фреймворк преобразования текста в 3D, нацеленный на повышение осведомлённости о 3D-содержании и устранение геометрических искажений при генерации эгоцентрических сцен. Во-первых, предлагается эгоцентрический генератор (Ego-centric Generator), который донастраивает модель многовидовой латентной диффузии (Multi-View Latent Diffusion Model) с использованием функции потерь с усилением согласованности для генерации согласованного и высококачественного 2D-контента, соответствующего текстовым описаниям. Затем декор компоновки (Layout Decorator) использует оптический поток и соответствие точек для оценки глубины, тем самым создавая плотные облака точек в качестве грубых макетов на основе эгоцентрических 2D-приоров. Опираясь на такую инициализацию, предлагается геометрический уточнитель (Geometric Refiner), который улучшает реконструкцию 3D-гауссианов с помощью энтропийной функции потерь взаимной информации глубины (MID) в сочетании с иерархической схемой оптимизации для повышения визуального качества и геометрической структуры. Всесторонние эксперименты демонстрируют, что CGGS превосходит предыдущие методы в генерации когерентных и точных 3D-сцен, управляемых текстом. Страница проекта: https://cggs-26.github.io/cggs26/.
Современные методы трехмерной реконструкции по одному изображению часто опираются на сложные гибридные архитектуры и функции потерь, либо сжимают геометрию в латентные пространства для использования предварительно обученных латентных диффузионных моделей. В данной работе мы показываем, что такие архитектурные издержки и запутанные формулировки потерь излишни. Мы представляем минималистичный диффузионный трансформер в пиксельном пространстве, построенный на простом ViT, который работает непосредственно с сырыми патчами трехмерной карты точек и обусловлен токенами изображений от предварительно обученного DINOv3. В отличие от существующих подходов латентной диффузии, мы обучаем наш диффузионный бэкбон полностью с нуля, устраняя необходимость в токенизаторах карт точек. Несмотря на свою простоту, наш подход превосходит сложные латентные диффузионные модели, оставаясь при этом значительно проще гибридных альтернатив. Примечательно, что он обеспечивает более четкую геометрическую структуру и более устойчив в сильно неоднозначных областях, таких как прозрачные объекты.
Мы представляем Nemotron-Labs-Diffusion — трёхрежимную языковую модель (ЯМ), объединяющую в рамках единой архитектуры авторегрессионное (AR) декодирование, диффузионное декодирование и самоспекулятивное декодирование. Обученная с помощью совместной AR-диффузионной целевой функции, Nemotron-Labs-Diffusion способна переключать режимы для поддержания высокой пропускной способности в различных сценариях развёртывания и при разных уровнях параллелизма. Наше исследование показывает, что (1) AR и диффузионная цели взаимодополняют друг друга: диффузия улучшает планирование с упреждением, в то время как AR предоставляет лингвистические априорные знания слева направо. (2) В режиме самоспекуляции диффузия генерирует черновик, а AR выполняет верификацию, превосходя методы многотокенного предсказания (MTP) как по уровню принятия, так и по эффективности на реальном устройстве. (3) Анализ, проведённый по принципу «скорости света», дополнительно демонстрирует долгосрочный потенциал диффузии: при использовании оптимального сэмплера она выдаёт до 76,5% больше токенов за один прямой проход по сравнению с самоспекуляцией. При масштабировании до 3, 8 и 14 миллиардов параметров семейство моделей Nemotron-Labs-Diffusion, включающее базовые, инструктивные и визуально-языковые версии, неизменно превосходит современные открытые AR и диффузионные ЯМ как по точности, так и по скорости. Например, модель Nemotron-Labs-Diffusion-8B декодирует в 6 раз больше токенов за прямой проход, чем Qwen3-8B, при сопоставимой точности, что приводит к 4-кратному увеличению пропускной способности на тесте SPEED-Bench при использовании SGLang на графическом процессоре GB200.
Групповая относительная оптимизация политики (GRPO) эффективна, когда текущая политика уже производит полезные траектории рассуждений, однако она затрудняется на сложных промптах, чьи правильные модальности решений находятся за пределами поддержки студенческой политики внутри политики. Мы предлагаем TREK (Учительская маршрутизация исследования через прямую KL-дивергенцию) — простую поэтапную процедуру, использующую дистилляцию не для имитации, а для расширения поддержки исследования. Ключевое преимущество TREK — его общность: поскольку он использует только верифицированные выходные траектории, он может применять внешнего черноящичного учителя, белоящичного учителя или ту же модель при наличии дополнительного контекста вывода, а также эффективно определять, какие образцы сложных промптов наиболее важны для закрепления, даже когда внутреннее устройство учителя недоступно. TREK сначала идентифицирует промпты, где несопровождаемый студент имеет очень низкий уровень прохождения, запрашивает источник предложений для создания верифицированных кандидатов решений, оставляет топ-r предложений, ранжированных по текущей правдоподобности студента, применяет короткую фазу прямой KL-дивергенции, чтобы втянуть эти верифицированные модальности в поддержку студента, а затем возвращается к стандартной оптимизации GRPO внутри политики. В математических рассуждениях TREK с предложениями DeepSeek-V4 улучшает модели Qwen3 на всех протестированных масштабах на AIME 2024 и AIME 2025; для Qwen3-8B он повышает AIME 2025 с 36,9 до 40,3 и AIME 2024 с 47,9 до 51,1 (avg@16), в то время как вариант с самоконтекстом достигает 38,5 и 49,6 без внешнего учителя. В агентных задачах TREK увеличивает уровень успеха ALFWorld с 75,8 до 82,8 и ScienceWorld с 12,5 до 26,7; примечательно, что на самых сложных типах задач TREK достигает высоких уровней успеха в начале обучения, тогда как несопровождаемый GRPO требует значительно большего количества шагов оптимизации для достижения сопоставимых уровней.
Мы представляем подход «Ранжируй-Затем-Действуй» (Rank-Then-Act, RTA) — фреймворк для обучения управляющих политик на основе видеоэкспертных демонстраций без использования внешних вознаграждений среды. RTA обучает модель «видение-язык» (Vision-Language Model, VLM) в автономном режиме как порядковый оценщик прогресса, используя цель групповой оптимизации относительной политики (Group Relative Policy Optimization, GRPO) на перемешанных последовательностях кадров. Это заставляет модель восстанавливать временной порядок на основе визуальной семантики, а не тривиальных временных подсказок. Важно, что вместо прямого использования оценщика как скалярной модели вознаграждения мы предлагаем функцию вознаграждения на основе корреляции для обучения с подкреплением: на каждом окне взаимодействия вычисляется ранговый коэффициент корреляции Спирмена между предсказанными рангами прогресса и истинными временными индексами, что даёт ограниченный, инвариантный к масштабу сигнал обучения. Такая конструкция отделяет обучение вознаграждению от абсолютной калибровки и обеспечивает стабильный перенос между задачами и средами. Мы оцениваем RTA на эталонных задачах дискретного управления (PyBoy: Catrap, Kirby) и непрерывного управления (PointMaze, MetaWorld). RTA стабильно достигает или превосходит результаты предыдущих методов обучения вознаграждению на основе видео и ранговых базовых линий, демонстрируя при этом сильное переиспользование одного предобученного оценщика прогресса на разных задачах. Наши результаты показывают, что структурированная корреляция с использованием порядковых сигналов, полученных из видео, достаточна для обучения политик, предлагая масштабируемую альтернативу явному конструированию вознаграждений.
Модели поиска с поздним взаимодействием, использующие функцию сходства MaxSim, демонстрируют высокую эмпирическую эффективность, часто превосходя одновекторные плотные и разреженные модели поиска. Несмотря на эти эмпирические результаты, теоретическая выразительная способность MaxSim и ее сравнение с другими подходами к поиску остаются малоизученными. В данной работе путем конструктивного построения показано, что сходство MaxSim может в точности воспроизводить скалярное произведение между любыми двумя неотрицательными k-разреженными векторами, возможно бесконечной размерности, требуя при этом лишь O(k) пространства для представления. Более того, существуют сходства, которые MaxSim способен выразить, в то время как стандартные скалярные произведения векторов с тем же пространством представления — нет. Используя нашу теоретическую основу, мы вводим Signed MaxSim, который позволяет моделям позднего взаимодействия в точности воспроизводить любое вещественное скалярное произведение, что, как мы доказываем, невозможно для стандартного MaxSim. Мы также показываем, что MaxSim может выступать в роли агрегации операций мягкой дизъюнкции (soft-OR) и как оценщик логических выражений в положительной конъюнктивной нормальной форме. Наши результаты свидетельствуют о том, что MaxSim как минимум так же выразителен, как стандартные скалярные произведения векторов для любых неотрицательных векторов, а наше расширение, Signed MaxSim, — для любых векторов. Обе функции сходства обладают дополнительными возможностями, которые скалярное произведение воспроизвести не способно, что является одним из первых теоретических обоснований и количественных оценок методов позднего взаимодействия. Наши теоретические выводы подкреплены эмпирически: в задаче поиска с запросами, содержащими отрицания, Signed MaxSim значительно улучшает производительность на данных из других предметных областей по сравнению с базовым методом ColBERT/MaxSim: nDCG@10 возрастает с 0,597 до 1,000 при сдвиге словаря и с 0,008 до 0,788 на запросах, содержащих только отрицания.
Агенты на основе LLM всё чаще полагаются на буферы извлечения для хранения и повторного использования прошлого опыта, однако политики управления кэшем, регулирующие эти буферы, остаются в значительной степени нестандартными. Мы формализуем эту проблему как задачу онлайн-замены семантического кэша с затратами на переключение, где элементы сопоставляются по эмбеддинговому сходству, а качество попадания является непрерывным, а не бинарным. В ходе экспериментов на двух наборах данных из MemoryBench-Full (LoCoMo, DialSim) с использованием 8 политик замены мы обнаруживаем неожиданный вывод: классические эвристики (LRU, LFU) постоянно уступают наивному базовому FIFO на семантических нагрузках из-за отсутствия временной локальности и концентрации частоты. Мы предлагаем SOLAR — обучаемую дополненную структуру, которая выводит время модификации из накопления сожалений (достигая уровня модификации около 17%) и выбор контента на основе байесовского онлайн-обучения по неявной обратной связи при извлечении. Мы доказываем, что SOLAR достигает постоянного коэффициента конкурентоспособности ≤3, независимо от размера кэша и горизонта (по сравнению с Ω(K) для FIFO), и сожаления при вытеснении O(KT log T), что совпадает с нижней границей Ω(KT) с точностью до логарифмических множителей. Эксперименты демонстрируют относительное улучшение на 5–75% по сравнению с FIFO при малых размерах кэша, с четко охарактеризованным фазовым переходом на границе рабочего набора. Синтетические эксперименты с пулами из 5000 элементов дополнительно выявляют перевернутую U-образную зависимость между размером пула и качеством извлечения, что обосновывает ограничения по емкости как явление шума при извлечении, а не как ограничение хранения.
Математическое рассуждение стало центральной задачей для оценки и настройки больших языковых моделей (БЯМ), способных к рассуждению, однако существующие бенчмарки остаются сильно смещёнными в сторону языков с высокими ресурсами: английский и китайский доминируют как в предобучающих корпусах, так и в оценочных наборах. Недавно опубликованный набор данных PolyMath (Wang et al., 2025) представляет собой значительный шаг вперёд, однако его охват по-прежнему ограничен только 18 языками с высокими ресурсами. Для устранения этого пробела мы представляем PluraMath — расширение PolyMath на 18 дополнительных недостаточно представленных языков, охватывающих 6 языковых семей — от языков со средним уровнем ресурсов до языков с крайне низким уровнем ресурсов. Мы создали набор данных с помощью человеческого курированного конвейера, в ходе которого носители языка тщательно проверяли предварительно вычисленные переводы. Используя PluraMath, мы затем провели бенчмаркинг 27 БЯМ для рассуждения в четырёх масштабах моделей — малых, средних, больших и ансамблей с закрытым исходным кодом — исследуя многоязычные способности к математическому рассуждению моделей передового уровня в различных лингвистических условиях. Наш детальный анализ подтверждает сохраняющийся разрыв в производительности математического рассуждения между языками с высокими ресурсами и недостаточно представленными языками, причём более высокие результаты в значительной степени связаны с лучшей способностью следовать инструкциям. Мы полностью публикуем с открытым исходным кодом наш набор данных, конвейер сбора данных и систему оценки с целью снижения барьера для создания многоязычных бенчмарков в сообществах с недостаточной представленностью.
Мультимодальные большие языковые модели (MLLM) генерируют ответы авторегрессивно, интегрируя визуальную и лингвистическую информацию в развивающемся контексте. Предыдущие работы по интерпретируемости были сосредоточены на отдельных слоях и цепях (где), оставляя малоизученной динамику на уровне токенов мультимодальных вычислений во время генерации (когда). Мы устраняем этот пробел и исследуем сдвиги внимания в зависимости от семантической роли, отслеживая внимание модели к изображению, тексту, инструкции и ранее сгенерированным токенам, один токен за раз (OTaT). Мы вводим мультимодальные задачи, требующие явного переключения между визуальным и текстовым контекстом в рамках одного ответа. На двух основных семействах моделей и четырех MLLM с открытыми весами разного размера мы устанавливаем устойчивые закономерности: внимание к изображению достигает пика на токенах, требующих полученной из изображения информации; токены инструкции повторно посещаются во время перехода между задачами; а внимание к ранее сгенерированным токенам возрастает по мере продвижения генерации. Каузальные вмешательства с блокировкой внимания подтверждают функциональную роль этих тенденций. Мы профилируем поведение модели при нарушенном внимании и наблюдаем, как ответы возвращаются к языковым априорам, либо демонстрируют кросс-модальную утечку, отрицание или восстановление. Наконец, руководствуясь нашей новой динамикой внимания, мы предлагаем простое вмешательство во время тестирования для усиления внимания к соответствующей модальности в нужный момент, что значительно улучшает производительность на мультимодальных задачах.
Иерархические модели Vision-Language-Action (VLA) разделяют планирование высокого уровня и низкоуровневое управление для улучшения обобщения в роботизированных манипуляциях. Недавние работы в этой парадигме используют траектории конечного эффектора в 2D, предсказанные Vision-Language Model (VLM), в качестве явного руководства для последующей политики. Однако современные низкоуровневые политики работают в трехмерном метрическом пространстве по облакам точек, и подача им 2D-руководства, лишенного глубины, вынуждает присваивать каждой промежуточной точке глубину той поверхности сцены, которая находится под ней, что приводит к геометрически искаженным траекториям. Мы предлагаем 3D HAMSTER — иерархическую структуру, устраняющую этот разрыв: планировщик напрямую выводит метрически надежные 3D-траектории. Мы дополняем VLM специализированным кодировщиком глубины и задачей плотной реконструкции глубины для предсказания последовательностей трехмерных точек пути, которые непосредственно интегрируются в низкоуровневую политику на основе облаков точек. В задачах прогнозирования трехмерных траекторий, симуляции и реальных манипуляций 3D HAMSTER последовательно превосходит проприетарные VLM и базовые подходы с 2D-руководством, причем наибольшие улучшения достигаются при изменениях внешнего вида, а также в невидимых ранее языковых, пространственных и визуальных условиях. Страница проекта доступна по адресу: https://davian-robotics.github.io/3D_HAMSTER/.
Мы представляем HunyuanOCR-1.5 — легковесную сквозную модель зрения-языка, специализированную на OCR. HunyuanOCR объединяет в рамках единой сквозной VLM такие задачи, как разбор документов, обнаружение текста, извлечение информации, перевод текста с изображения и понимание документов на основе нескольких изображений. Опираясь на легковесную архитектуру HunyuanOCR-1.0, HunyuanOCR-1.5 не перерабатывает магистраль, а систематически улучшает как эффективность, так и функциональные возможности. Для повышения эффективности мы адаптируем DFlash для декодирования OCR, что значительно снижает задержку при формировании длинных структурированных выходных данных, таких как плотные документы, таблицы и формулы, сохраняя при этом распределение результатов. Благодаря DFlash HunyuanOCR-1.5 достигает ускорения вывода Transformer в 6,37 раза и ускорения в 2,14 раза при работе с vLLM, обеспечивая тем самым самый быстрый вывод среди легковесных OCR VLM. Для расширения функциональных возможностей мы предлагаем Agentic Data Flow — агентно-управляемую систему конструирования данных, которая преобразует слабые стороны модели в выполнимые требования к данным и автономно выполняет поиск материалов, проверку качества и разработку конвейеров. Это существенно улучшает возможности в области длиннохвостых задач: OCR древних письменностей, детального анализа диаграмм и таблиц, вопросно-ответных систем, ориентированных на текст на нескольких изображениях, многозыкового разбора при ограниченных ресурсах, а также оценки галлюцинаций в документах. HunyuanOCR-1.5 входит в число лучших сквозных OCR-решений на OmniDocBench v1.6, одновременно устанавливая новые рекорды производительности в этих длиннохвостых задачах. В сочетании с обновленной методикой предварительного и последующего обучения HunyuanOCR-1.5 дополнительно расширяет свои возможности в сценариях с высоким разрешением, длинным контекстом и несколькими задачами. Эксперименты демонстрируют более быстрый вывод, более широкий охват возможностей OCR и преимущества развертывания легковесной сквозной модели. Мы планируем выпустить веса модели и код обучения для поддержки будущих исследований и реальных приложений OCR.
Обучение с подкреплением (RL) стало ключевым компонентом пост-тренировочной адаптации больших языковых моделей (LLM), однако мало что известно о том, как распределяется RL-адаптация по слоям трансформера. Существующие подходы, как правило, обновляют все параметры модели равномерно, неявно предполагая, что каждый слой вносит аналогичный вклад в выигрыш, получаемый в ходе пост-тренировочного RL. В данной работе мы подвергаем сомнению это предположение путем систематического послойного изучения RL-обучения. Удивительно, но мы обнаружили, что обучение одного единственного слоя трансформера может восстановить большую часть выигрыша, достигнутого при полнопараметрическом RL-обучении, а в некоторых случаях даже превзойти его. Для количественной оценки этого явления мы вводим величину «вклад слоя», которая измеряет долю полного RL-улучшения, восстановленную при обучении изолированного слоя. На примере семи моделей, охватывающих два семейства (Qwen3, Qwen2.5), три RL-алгоритма (GRPO, GiGPO, Dr. GRPO) и несколько предметных областей, включая математические рассуждения, генерацию кода и принятие решений агентом, мы наблюдаем удивительно устойчивую закономерность: выигрыш от RL в высокой степени сконцентрирован в небольшом подмножестве, а во многих случаях и в одном единственном слое трансформера. Что еще более поразительно, последовательно проявляется одна и та же структурная закономерность: слои с высоким вкладом сосредоточены в середине стека трансформера, тогда как слои вблизи входного и выходного концов вносят существенно меньший вклад. Полученные ранжирования слоев остаются сильно коррелированными между наборами данных, задачами, семействами моделей и RL-алгоритмами.
Кодирующие агенты всё чаще генерируют pull request'ы (PR) для решения реальных проблем программного обеспечения, однако однократная генерация PR остаётся разомкнутой: PR предлагается без систематического анализа, диагностики или доработки. Мы представляем SWE-Review — фреймворк для замыкания этого цикла с помощью агентного ревью кода. Имея задачу и сгенерированный ИИ PR, агент-рецензент исследует репозиторий, принимает решение о принятии PR и предоставляет структурированную обратную связь для доработки. Мы оцениваем данную постановку с помощью предложенного нами SWE-Review-Bench для измерения как корректности ревью, так и полезности последующих доработок. Кроме того, мы формируем набор данных SWE-Review-Traj для изучения более широких применений агентного ревью и восполнения дефицита данных для открытого обучения рецензентов. Эксперименты показывают, что агентное ревью непрерывно улучшает PR через цикл «генерация–рецензирование–доработка», превосходит однократное ревью с фиксированным контекстом как по точности решений, так и по доле успешных доработок, переносится за пределы ревью для улучшения моделей решения задач, а также обеспечивает эффективное масштабирование на этапе тестирования. Эти результаты позиционируют агентное ревью кода как практический механизм для перехода от однократной генерации PR к замкнутому циклу решения задач.
Аудиовизуальные искусства охватывают разнообразные творческие дисциплины, включая кинематограф, изобразительное искусство, сценическое исполнительство и дизайн игр, где художественный смысл возникает из намеренных комбинаций визуальных, слуховых и нарративных элементов (например, страх, усиленный клаустрофобным кадрированием, или горе, передаваемое через тишину и затяжные крупные планы). Истинное понимание искусства выходит за рамки распознавания того, что изображено, и включает рассуждения о том, почему это выражено через определённые творческие решения. Несмотря на значительный прогресс мультимодальных больших языковых моделей (MLLMs), этот ключевой аспект понимания искусства остаётся малоизученным, поскольку существующие бенчмарки в основном измеряют перцептивное распознавание, упуская рассуждения о творческом намерении. Для устранения этого пробела мы представляем Musebench — всеобъемлющий бенчмарк, предназначенный для оценки MLLMs в тонком понимании искусства. Он включает 4 016 вопросов, охватывающих кинематографическое искусство, статическое визуальное искусство, сценическое исполнительское искусство и игровое искусство, извлечённых из более чем 10 тысяч кандидатских видеоэссе, в которых профессиональный комментарий сочетается с визуальной демонстрацией. Для масштабного отражения открытого характера художественного анализа бенчмарк сочетает вопросы с одним выбором и вопросы с множественным выбором с переменным количеством вариантов. Все вопросы генерируются и уточняются с помощью четырёхфазного итеративного конвейера, объединяющего фильтрацию по сокращённым путям, противостоящие дистракторы и экспертную валидацию. Всесторонняя оценка в режиме zero-shot 28 современных MLLMs показывает, что даже лучшая модель достигает лишь 48,29% точности, что существенно ниже показателей экспертов-людей (87,18%), выявляя значительный разрыв в экспертизе текущих моделей в области творчества.
Модели Vision-Language-Action (VLA) обычно обучаются с помощью имитационного обучения на крупномасштабных наборах данных с демонстрациями роботов, однако увеличение объема данных не обязательно приводит к улучшению стратегий из-за избыточности, шума и неравномерного покрытия. Существующие методы выбора данных часто оценивают демонстрации на уровне траекторий или пар состояние-действие, упуская из виду повторно используемые структуры, из которых состоят долгосрочные поведения. В этой статье мы предлагаем SIEVE — метод структурно-осознанного выбора данных для имитационного обучения VLA. SIEVE рассматривает демонстрации как композиции повторно используемых примитивов и интерфейсов перехода. Сначала он обнаруживает визуомоторные примитивы из сегментированных траекторий, затем распределяет бюджеты выбора по шаблонам композиции, максимизируя структурную экспозицию с учетом повторного использования в условиях убывающей отдачи. Наконец, он выбирает траектории-медоиды в пределах каждого сегмента шаблона композиции, чтобы сохранить центральные, стабильные и благоприятные для имитации демонстрации. Эксперименты на нескольких наборах данных, бенчмарках и моделях VLA показывают, что SIEVE последовательно превосходит конкурирующие базовые методы выбора данных. Примечательно, что SIEVE может превзойти обучение на полных данных, используя лишь 50% демонстраций и 50% шагов обучения, что позволяет предположить, что повторно используемая структура, фиксируемая через примитивы и переходы, является важным сигналом для эффективного имитационного обучения VLA.
Любая химическая языковая модель, читающая SMILES, начинается с токенизатора, однако в этой области кодирование пар байтов (BPE) было унаследовано из естественного языка без должного критического анализа. В обработке естественного языка основная альтернатива BPE — Unigram-LM — известна тем, что формирует структурно иные словари. Было неясно, сохраняется ли это различие в химии. Мы провели контролируемое сравнение BPE и Unigram-LM на фиксированной химической базе из 165 токенов, при малых размерах словаря, когда внедрения токенов обучаемы, на трех типах корпусов (разнообразные, лекарственноподобные, природные продукты) и при обеих политиках границ предтокенизации. Два метода не сходятся. Во всех 22 сопоставимых условиях они формируют почти непересекающиеся подсловные словари: перекрытие по Жаккару между алгоритмами для выученных единиц никогда не превышает 0,161, а с весовым учетом высокочастотных единиц, которые модель обновляет чаще всего, — не более 0,05. Unigram-LM также сегментирует отложенные молекулы на 29–41% больше токенов; оба подхода в основном согласуются, где производить разрез, но не в его глубине, так что сегментация BPE является строгим огрублением сегментации Unigram-LM для 80–99% молекул. Различие сохраняется для всех корпусов, границ и размеров словаря, даже при восьмикратном увеличении этого масштаба. Таким образом, выбор алгоритма подслов является моделировочным решением, а не свободным значением по умолчанию. В исследовании не обучались никакие языковые модели.
Значительные различия существуют в диагностике и клинических проявлениях депрессии среди разных языковых популяций. Выявление депрессии по речи хорошо работает в одноязычном режиме, однако кросс-языковое обобщение остаётся открытой проблемой. Ключевая причина заключается в том, что предыдущие работы используют случайное разбиение на уровне сегментов без группировки по дикторам, что приводит к утечке идентичности и завышает сообщаемые показатели. Мы предлагаем CLeaD — фреймворк контролируемого контрастивного выравнивания, который отображает эмбеддинги WavLM из английского и мандаринского языков в общее клиническое пространство без параллельных данных или тонкой настройки на целевом языке. При оценке на 52 носителях мандаринского языка контрастивное выравнивание незначительно превосходит базовый метод (F1: 0,640 против 0,622) в условиях оценки с исключением одного диктора. Оно также улучшает полноту для класса депрессии на промежуточных слоях (7–8), хотя небольшой тестовый набор ограничивает обобщаемость. Два вывода остаются устойчивыми: масштабирование модели ухудшает кросс-языковую производительность при одновременном улучшении одноязычной для английского, а утечка идентичности диктора искусственно завышала ранее сообщаемые значения F1 для мандаринского до 0,954 — артефакт, который мы воспроизводим и количественно оцениваем.
Академические результаты создаются в условиях фрагментированной цепочки инструментов: поиск литературы в одном приложении, управление ссылками — в другом, написание текста — в LaTeX-редакторе, ручное форматирование по шаблонам изданий, а подача — через очередной портал. Каждый переход между инструментами требует переключения контекста, преобразования формата или ручного копирования, и совокупные затраты доминируют над временем, которое исследователи тратят на деятельность, не связанную с исследованием. Мы представляем Bibby AI — платформу, встроенную в редактор, которая сворачивает эту цепочку в единый конвейер «Исследование — Написание — Публикация», построенный вокруг облачного LaTeX-редактора. В отличие от ассистентов, подключающихся к существующему редактору через расширение браузера, Bibby AI полностью контролирует состояние документа, конвейер компиляции и историю изменений, что позволяет его агентам выполнять вставку цитирования на основе поиска, структурные правки и переформатирование в соответствии с шаблоном как первоклассные верифицируемые операции, а не текстовые предложения. Платформа включает (i) конвейеры приёма, преобразующие PDF, DOCX и рукописные математические формулы в чистый LaTeX; (ii) слой поиска по академическим метаданным, обогащённый сигналами цитирования между патентами и статьями, полученными из USPTO PatentsView и корпуса цитирований Marx-Fuegi, что позволяет выявлять трансляционное влияние потенциальных ссылок; и (iii) агентов с заданной областью задач для отбора литературы, создания черновика, редактирования и форматирования по требованиям изданий, работающих непосредственно с абстрактным синтаксическим представлением документа. Bibby AI развёрнут в производственной среде и обслуживает более 5 000 активных исследователей из более чем 50 университетов-подписчиков. Мы описываем архитектуру, проектные решения, ставшие возможными благодаря встроенности в редактор, и систему оценки экономии времени на уровне рабочего процесса, которую мы используем для сравнения платформы с фрагментированными базовыми подходами.
Мы представляем RuleChef — фреймворк, использующий большие языковые модели (LLM) для генерации исполнимых правил для таких задач NLP, как классификация текстов, распознавание именованных сущностей (NER) или извлечение отношений. Правила генерируются на основе описания задачи и набора размеченных примеров, затем итеративно улучшаются как на основе дополнительных примеров, так и с учетом обратной связи от человека по существующим правилам. RuleChef также можно использовать для начальной загрузки правил на основе наблюдаемых пар «вход-выход» от любой существующей модели для данной задачи. LLM применяются только на этапе обучения: они синтезируют правила и итеративно корректируют их на основе ошибок, измеренных на отложенной выборке. Результатом этого процесса является быстрая, детерминированная и инспектируемая система правил. Предварительная оценка проводится как для задач классификации, так и для NER. Мы выпускаем RuleChef как программное обеспечение с открытым исходным кодом под лицензией Apache 2.0.
Геометрически обусловленная генерация 3D-сцен позволяет создавать трехмерные окружения на основе предоставленной пользователем геометрии, обеспечивая прямой контроль над структурой сцены и расположением объектов. Для генерации таких 3D-сцен современные методы обычно используют трехэтапную схему: сначала определяется расписание ракурсов, затем синтезируются многовидовые наблюдения вдоль запланированных ракурсов, и наконец, из полученных изображений восстанавливается 3D-представление. Однако определение расписания ракурсов становится основным узким местом для наружных сцен, где большая, неструктурированная и неограниченная геометрия затрудняет получение ракурсов, обеспечивающих достаточное покрытие при поддержке стабильной генерации. Для решения этой проблемы мы представляем SceneFrom3D — фреймворк, который автоматически планирует ракурсы на основе входной геометрии наружных сцен. SceneFrom3D строит направленный граф генерации, узлы которого представляют опорные ракурсы, а ребра — траектории интерполяции, определяя, какие ракурсы синтезировать, какие пары ракурсов интерполировать и в каком порядке должна выполняться генерация. Помимо автоматического планирования ракурсов, SceneFrom3D дополнительно улучшает управляемость за счет объектно-уровневого кондиционирования, назначая каждому объекту идентификационное изображение для управления внешним видом и параметр соответствия геометрии для регионального контроля над входной геометрией. Эксперименты показывают, что SceneFrom3D достигает современного уровня в геометрически обусловленной генерации наружных 3D-сцен, создавая высококачественные сцены с управляемым внешним видом объектов и степенью соответствия геометрии.
Воплощенная навигация направлена на создание агентов, которые интерпретируют мультимодальные цели, рассуждают в трехмерном пространстве и надежно достигают целевых пунктов назначения в реальном мире. Однако прогресс остается ограниченным из-за отсутствия масштабируемых, высокоточных и физически обоснованных интерактивных сред. Хотя сканированные наборы данных реального мира обеспечивают визуальную реалистичность, они ограничены по масштабу. Напротив, синтетические симуляторы легче масштабируются, но часто демонстрируют большие разрывы между симуляцией и реальностью. Мы представляем Image2Sim — фреймворк нейронной симуляции в реальном времени, который создает высококачественные интерактивные среды из последовательностей RGB-D изображений с известными позами. Центральная идея заключается в разделении трехмерной пространственной привязки и синтеза фотореалистичных наблюдений. Для построения сцен Image2Sim использует прямую модель гауссианов признаков, которая за один проход преобразует RGB-D наблюдения с известными позами в трехмерное представление гауссианов признаков. Для рендеринга мы предлагаем модель однократного потока пикселей с учетом геометрии, которая преобразует разреженные и зашумленные проекции гауссианов в высококачественные панорамные RGB-D наблюдения. Image2Sim также служит полностью автоматизированным воплощенным движком данных, который генерирует высокоточные наблюдения, выполнимые действия и разнообразные инструкции по навигации в масштабе. Он преобразует большие коллекции видео и изображений в почти 20 тысяч интерактивных сцен и синтезирует более 10 миллионов обучающих примеров для навигации. Модели навигации, обученные исключительно в этих нейронных средах, достигают значительных улучшений на основных эталонных тестах и эффективно переносятся в реальные условия без дополнительного обучения. Эти результаты показывают, что масштабируемая нейронная симуляция может служить практической основой для тренировки воплощенной навигации в больших масштабах.
В последнее время Совместные архитектуры прогнозирования вложений (Joint Embedding Predictive Architectures, JEPAs) привлекли значительное внимание в сообществах компьютерного зрения и машинного обучения как перспективная рамка для самообучающегося представления. В отличие от маскированных автоэнкодеров, которые реконструируют пиксели, модели JEPA обучают представления путем прогнозирования скрытых вложений маскированных областей. Существующие методы на основе JEPA, такие как I-JEPA и V-JEPA, обычно используют один кодировщик в сети-студенте. Напротив, использование сиамских кодировщиков для сети-студента более естественно соответствует основанным на мозге рамкам обучения представлений, однако их роль в моделях JEPA остается малоизученной. В данной работе мы исследуем влияние сиамских кодировщиков-студентов в обучении представлений на основе JEPA. Для этого мы предлагаем SiamJEPA — маскированные сиамские кодировщики-студенты, оснащенные сетью-учителем с экспоненциально скользящим средним (EMA). SiamJEPA также можно рассматривать как JEPA-формулировку модели обучения представлений, вдохновленной биологией мозга, PhiNet. Посредством обширных экспериментов с линейным зондированием на ImageNet мы демонстрируем, что сиамские кодировщики действуют как эффективный регуляризатор для цели JEPA, улучшая разделимость представлений и ускоряя обучение на ранних этапах тренировки. Кроме того, SiamJEPA стабильно превосходит сопоставимые варианты JEPA с одним кодировщиком при ограниченных бюджетах обучения и достигает более высокой точности линейного зондирования, чем маскированные автоэнкодеры (MAE), требующие более длительного обучения. Наши результаты показывают, что сиамские кодировщики-студенты являются не просто архитектурным выбором, но составляют важное индуктивное смещение для прогнозирующего обучения представлений. Эти результаты дают новое понимание проектирования моделей на основе JEPA и предполагают, что включение сиамских архитектур-студентов представляет собой простой, но эффективный подход к улучшению самообучающегося представления.
Большие аудио-языковые модели (Large Audio-Language Models, LALM) всё чаще интегрируются в повседневные приложения, однако их генеративные предвзятости остаются малоизученными. Существующие критерии справедливости для речи опираются на синтезированную речь и вопросы с множественным выбором (Multiple-Choice Questions, MCQ), что даёт лишь фрагментарное представление о справедливости. Мы предлагаем VIBE — структуру, оценивающую генеративную предвзятость через задачи открытого типа, такие как персонализированные рекомендации, с использованием речи, записанной людьми. В отличие от MCQ, наш метод позволяет стереотипным ассоциациям проявляться естественным образом без заранее заданных вариантов, что делает его легко расширяемым на новые задачи. Оценка 12 современных LALM выявляет систематические предвзятости в реалистичных сценариях. Как гендерные, так и акцентные признаки вызывают статистически значимые сдвиги распределений, а величина предвзятости сильно зависит от задачи.