Ежедневно отобранные исследовательские статьи по ИИ с переводами
Выбор оптимизатора для обучения крупномасштабных моделей стал проектным решением на системном уровне, ограниченным совместно вычислительными ресурсами, памятью, бюджетом на настройку и разнообразием задач, при этом ландшафт из более чем ста методов остаётся фрагментированным. Поэтому мы представляем OmniOpt — унифицированный обзор и сборник эталонных тестов оптимизаторов для исследовательского сообщества. OmniOpt основан на четырёх взаимосвязанных компонентах. Во-первых, мы рассматриваем каждое обновление оптимизатора как структурированное преобразование через пятиэтапный мета-конвейер и показываем, что большинство методов задействуют только один или два из этих этапов. Во-вторых, мы используем оракулы линейной минимизации с ограничением нормы (LMOs) для унификации различных оптимизаторов. В-третьих, эти два взгляда обосновывают двумерную таксономию, одно измерение которой относит каждый метод к семейству механизмов, а другое фиксирует измеримые цели обучения, которые он стремится улучшить. В-четвёртых, и это является ядром данной статьи, мы воплощаем полную таксономию в унифицированном междисциплинарном эталонном тесте, охватывающем репрезентативные оптимизаторы, масштабы моделей и режимы обучения — от предварительного обучения языковых моделей до классификации изображений, систематически анализируя каждое семейство методов по множеству целевых эффектов и описывая их компромиссы. Таким образом, OmniOpt предоставляет исследовательскому сообществу операционную систему координат для выбора оптимизаторов при явных допущениях о механизмах и целях, а также задаёт направление для будущего развития сообщества оптимизаторов.
Последние достижения в области мультимодальных фундаментальных моделей и агентных систем стимулировали переход GUI-агентов от выполнения задач на одной платформе к кроссплатформенному взаимодействию. Однако создание многоплатформенных GUI-агентов по-прежнему сопряжено с трудностями. С одной стороны, качественные и выполнимые траектории кроссплатформенного взаимодействия остаются дефицитными, а существующие данные часто характеризуются ограниченным охватом платформ. С другой стороны, различные платформы демонстрируют отличные соглашения о взаимодействии, что делает совместное или последовательное обучение склонным к смешению поведенческих шаблонов, ухудшению специфичных для платформы способностей и катастрофическому забыванию. Для решения этих проблем мы создали Uni-GUI — высококачественный набор данных кроссплатформенного GUI-взаимодействия, и предложили UI-MOPD — первый метод, интегрирующий многопреподавательскую дистилляцию на политике в непрерывное обучение для GUI-агентов. UI-MOPD динамически выбирает специфичного для платформы преподавателя в соответствии с текущей средой и переносит специфичные для платформы поведенческие априорные знания в общую политику посредством дистилляции с учетом платформы, обеспечивая адаптацию к новым платформам при сохранении способностей на существующих. Эксперименты на OSWorld и MobileWorld показывают, что UI-MOPD достигает показателей успешности выполнения задач 38,2% и 12,0% соответственно, демонстрируя свою эффективность в балансировании сохранения кроссплатформенных способностей и адаптации к новым платформам. Страница проекта: https://elispectre.github.io/UI-MOPD/.
Распространение научных результатов — преобразование статьи в постер, видео выступления и запись в блоге — по-прежнему остается ручной последней милей. Существующие подходы к автоматизации обрабатывают каждый артефакт изолированно: каждый заново извлекает информацию из статьи с нуля, обычно создает односторонний рендеринг, который автор не может открыть в PowerPoint или Word, и оценивает качество по мягким оценкам предпочтений VLM, которые выходят на плато, в то время как несущие разделы по-прежнему выглядят пустыми. Мы утверждаем, что эту последнюю милю лучше всего строить как композицию навыков: тонких контрактов, понятных для агентов, которые используют один вышестоящий экстрактор и оборачивают детерминированные примитивы в цикл с измеряемым заполнением, выходы из которого представляют собой жесткие пороги рендеринга с результатом «пройдено/не пройдено». Мы реализуем этот подход в виде ResearchStudio-Reel, пяти навыков на базе Claude Code и Codex, организованных в один общий экстрактор (Paper2Assets), три редактируемых генератора (Paper2Poster, Paper2Video, Paper2Blog) и один интерактивный слой конвергенции (Paper2Reel). Paper2Assets однократно извлекает данные из каждой статьи в общий набор, который может быть повторно использован любым нижестоящим навыком; три генератора создают готовый к печати постер, синхронизированное видео выступления и двуязычный блог, которые остаются фактически согласованными и допускают круговой обмен через PowerPoint или Word; Paper2Reel затем объединяет все три в автономный HTML-просмотрщик, в котором клики по разделам переключают видео, слайды, подписи и блог на соответствующий контент. На бенчмарке Paper2Poster наши постеры превосходят как предыдущие автоматические системы, так и однопроходные передовые LLM по каждому эстетическому и информационному подкритерию, обходят собственные постеры авторов по эстетике по оценкам двух отложенных VLM-судей и одерживают общую победу по 84%–93% статей; аудит возможностей также показывает, что благодаря уникальному сочетанию выделений на слайдах, согласованных с повествованием, и двуязычному блогу, контролируемому с помощью учитывающего разметку восстановления DOCX, ResearchStudio-Reel является единственным конвейером, который поставляет все три редактируемых артефакта. Проект доступен по адресу: https://aka.ms/ResearchStudio
3D реконструкция и генерация обычно решаются с помощью раздельных парадигм: пиксельной регрессии для реконструкции и латентной диффузии для генерации. Недавние работы пытаются объединить их в латентном пространстве, но с заметными недостатками: целевая функция диффузии определяется на латентных признаках, а не на базовом 3D-представлении, и обе ветви страдают от потери информации, вызванной латентным кодированием, при этом требуя предварительно обученный вариационный автокодировщик (VAE) или автокодировщик представлений (RAE). В данной статье мы переформулируем эти две задачи в рамках единой парадигмы диффузии в пиксельном пространстве и представляем PixWorld — единую модель, которая совместно решает задачи 3D реконструкции и генерации. Осуществляя супервизию диффузии непосредственно на рендеренных изображениях, PixWorld устраняет указанные ограничения и согласовывает оптимизацию с точностью 3D-сцены. Помимо фотометрической и перцептивной супервизии, работающей на уровне 2D-изображений и лишенной 3D-геометрической осведомленности, мы дополнительно вводим потерю геометрического восприятия, которая выравнивает рендеренные виды с их истинными значениями в геометрически осмысленном пространстве признаков предварительно обученной 3D-фундаментальной модели, обеспечивая 3D-структурную супервизию. PixWorld последовательно превосходит предыдущие методы генерации в латентном пространстве и соответствует современным методам реконструкции, демонстрируя превосходство единого подхода на основе пиксельного пространства.
Большие языковые модели сделали генерацию исследовательских идей всё более доступной, однако эффективная разработка идей требует не только создания возможных направлений. Исследователи должны обосновать проблему в контексте современной литературы, выявить значимые узкие места, отличить своё решение от существующих и оценить риски, прежде чем приступать к реализации. Мы представляем ResearchStudio-Idea как многократно используемый набор навыков для этого первого этапа исследовательской идеации. В состав набора входят: Paper-Search — автономный навык поиска литературы по нескольким источникам; Scoop-Check — автономный навык проверки на пересечения с предшествующими работами для обоснования новизны; и IdeaSpark — сквозной навык, объединяющий в единый рабочий процесс обоснование на основе данных, генерацию с использованием шаблонов, поиск коллизий, аудит и визуализацию карточек идей. IdeaSpark создан на основе корпуса из 1 947 статей конференций по машинному обучению, собранных с ICLR, ICML и NeurIPS за 2021–2025 годы, включая устные доклады, отдельно отслеживаемую подвыборку с высоким уровнем цитирования и отклонённые заявки. Анализ этих результатов выявил 31 повторяющийся подпаттерн идеации, объединённый в 15 многократно используемых паттернов идеации. Каждый паттерн реализован в виде структурированной карточки, содержащей исследовательские контексты, типы узких мест, стратегии дифференциации, подтверждающие прецеденты и типичные сценарии отказов. Задав исследовательскую проблему и набор данных, IdeaSpark оценивает готовность данных, реконструирует окружающий исследовательский контекст, выявляет нерешённые узкие места, выбирает подходящие паттерны, создаёт одно из возможных направлений, выполняет поиск потенциально конфликтующих предыдущих работ и проводит аудит на основе результатов. Этот рабочий процесс превращает многократно используемые паттерны идеации в прослеживаемые исследовательские предложения. Результаты слепых оценок с помощью автоматического судьи показывают, что IdeaSpark последовательно создаёт более сильные исследовательские предложения по сравнению с базовыми показателями без навыков и с общими навыками, сохраняя при этом конкурентоспособную новизну.
Концептуальное удаление направлено на удаление целевого концепта из представления с сохранением другой закодированной в нем информации. Это сложно, поскольку представления кодируют множество концептов, часто коррелирующих с целью удаления, так что удаление цели может повредить их. Мы предлагаем гипотезу ограничения многообразием (Manifold Constraint Hypothesis, MCH): если естественные представления концентрируются на структурированном многообразии меньшей размерности, то вмешательства следует ограничивать этим многообразием, что позволит лучше сохранять другую информацию, закодированную в представлении, в ходе таких вмешательств. Мы реализуем MCH в новом методе концептуального удаления: MANifold aware Concept Erasure (MANCE). MANCE выполняет итеративные обновления представлений, используя сигналы от классификатора, предсказывающего целевой концепт. Мы оцениваем многообразие на основе представлений, полученных из естественных входных данных, а затем проецируем обновление удаления концепта на это оцененное многообразие. Мы проводим обширную оценку на 119 конфигурациях, охватывающих текст и изображения, включая 13 языковых моделей, три концепта обработки естественного языка и 40 атрибутов CelebA-CLIP. Применение MANCE поверх предыдущих методов показывает последовательное улучшение результатов по утечке. Мы также представляем MANCE+ и MANCE++, которые предваряют использование MANCE алгоритмом удаления в замкнутой форме, достигая лучших компромиссов между утечкой и аккуратностью по сравнению с сопоставимыми обновлениями в полном пространстве. MANCE++, наш лучший метод, достигает самых современных результатов по нелинейному концептуальному удалению. Эти результаты подтверждают MCH в контексте удаления: вмешательства должны быть ограничены естественным многообразием представлений.
Оценка воплощённых фундаментальных моделей для роботов остаётся критическим узким местом: в отличие от больших языковых моделей, эффективно оцениваемых с помощью цифровых бенчмарков, роботизированные политики требуют медленных, затратных развёртываний в реальном мире, ограниченных оборудованием и человеческим контролем, что стимулирует интерес к моделям мира в качестве суррогатных оценщиков политик, однако ключевые свойства, определяющие надёжность модели мира для оценки политик, остаются слабо изученными. В данной работе представлено систематическое исследование моделей мира для оценки роботизированных политик и вводится WMBench — бенчмарк, построенный на данных телемации реальных роботов и соответствующих развёртываний политик, охватывающий разнообразные задачи манипуляции, что позволяет проводить контролируемые сравнения между семействами моделей, кодировками действий, горизонтами развёртывания и метриками оценки. Используя WMBench, мы анализируем 7 видеомоделей мира, 4 схемы представления действий и более 324 000 симулированных развёртываний политик в паре с реальными исполнениями роботов, дополнительно обогащая наш анализ крупномасштабными поступлениями от сообщества в рамках GigaBrain Challenge на CVPR 2026, кураторскими синтетическими траекториями и обучающими видео общей длительностью свыше 12 000 часов. Наши эксперименты дают три ключевых вывода: качество оценщика определяется в первую очередь согласованностью развёртываний на длинных горизонтах с точным следованием действиям, а не краткосрочным визуальным реализмом; преимущества предобучения обусловлены не только масштабом данных, но и балансом между общими знаниями о мире и управляемостью, специфичной для роботов; архитектурные решения, включая кодировку действий, дизайн памяти и последующее обучение, ориентированное на оценщик, сильно определяют согласованность с реальным поведением робота. Основываясь на этих результатах, мы выводим практическую дорожную карту и реализуем её в GigaWorld-1 — модели мира, специально оптимизированной для оценки политик, и полностью публикуем наш код, модели, наборы данных и инструментарий для продвижения масштабируемых исследований оценки воплощённых фундаментальных моделей.
Плотное пространственное восприятие необходимо для физического интеллекта, где ожидается, что визуальные системы будут восстанавливать структурированные, метрические и пригодные для действий представления на основе пиксельных наблюдений. Современные фундаментальные модели зрения склонны отдавать приоритет семантической инвариантности, часто в ущерб детальному пространственному пониманию. В данной работе мы исследуем предобучение зрения через оптику, ориентированную на границы, исходя из предпосылки, что границы и разрывы формы предоставляют ключевые подсказки для восприятия геометрических свойств. Конкретно, мы предлагаем маскированное моделирование границ — самоконтролируемую парадигму, которая динамически обучает субпиксельные представления границ и впоследствии использует обнаруженные токены, содержащие границы, в качестве маскированных целей для обучения плотных визуальных токенов. Масштабируя этот фреймворк, мы разрабатываем LingBot-Vision и демонстрируем его эффективность на разнообразном наборе последующих задач компьютерного зрения, используя DINOv3 в качестве сильного базового уровня. Примечательно, что LingBot-Vision стимулирует переход от LingBot-Depth 1.0 к LingBot-Depth 2.0 для восстановления глубины, тем самым улучшая оценку глубины — ключевой столп воплощённого искусственного интеллекта. Наши результаты показывают, что моделирование границ выходит за рамки простых отрезков линий и вместо этого служит масштабируемым принципом предобучения для обучения пространственно структурированных визуальных представлений.
Представляем Wan-Streamer v0.2 — обновление с сохранением задержки для сквозной аудиовизуальной модели взаимодействия с нативной потоковой передачей. Версия v0.2 сохраняет формулировку модели v0.1, но повышает разрешение выходного интерактивного потока с 192×336 до 640×368, сохраняя задержку сигнал-сигнал на стороне модели порядка 200 мс при 25 FPS. Поток более высокого разрешения поддерживает агентов среднего плана, привязанных к сцене, чьи поза, взгляд, руки, близлежащие объекты и локальный план сцены остаются различным в ходе диалога в реальном времени. Для поддержки увеличенного визуального потока без добавления заметной для пользователя задержки v0.2 сохраняет «мыслитель» (thinker) как одногпу путь с низкой задержкой для потокового восприятия, короткий проход трансформера для языка/состояния, формирующий кэш генерации, и финальное декодирование. «Исполнитель» (performer) превращается в многогпу группу контекстного параллелизма в стиле Ulysses для ресурсоемкой латентной генерации следующего элемента. Каждый ранг исполнителя записывает входящие K/V в предварительно шардированный локальный кэш. Длинная латентная видеопоследовательность высокого разрешения разделяется между рангами для шумоподавления и собирается через коммуникацию Ulysses, в то время как значительно более короткая аудиолатентная последовательность генерируется без шардирования последовательности. В таком разделении вычисления языка/состояния мыслителя достигают исполнителя только в виде K/V-обусловливания, поэтому внутри группы исполнителя не требуется передавать отдельную языковую последовательность. Это концентрирует дополнительные аппаратные ресурсы на визуальной генерации, сохраняя компактную границу между мыслителем и исполнителем, что обеспечивает суммарную задержку удаленного взаимодействия порядка 550 мс с учетом выделенных 350 мс на двунаправленное сетевое взаимодействие.
Мы представляем EVA-Client — открытую платформу для развертывания, сбора данных и оценки обученных политик манипуляции на реальных роботах. Располагаясь между сервером политик и физическим оборудованием, EVA-Client объединяет этапы работы с реальным роботом в цикле итерации политик в рамках единой кодовой базы. Платформа вносит три вклада. Во-первых, архитектура с декомпозицией компонентов, в которой бэкенды роботов, стратегии вывода и транспортные промежуточные слои образуют ортогональную сетку: добавление робота или стратегии затрагивает только соответствующий слой. Во-вторых, инспектируемое выполнение через рабочие процессы Debug, Collect и Eval с режимами, варьирующимися от имитации с разомкнутым контуром до непрерывного управления в реальном времени. В-третьих, каждый оценочный прогон одновременно служит сбором данных, записывая полные развёртывания в формате, готовом для обучения, вместе с исчерпывающими журналами и средством просмотра для сравнения «бок о бок», так что каждая оценка питает следующий раунд обучения, а не завершается как незафиксированное впечатление. EVA-Client дополнительно консолидирует основные стратегии вывода в реальном времени — синхронное и асинхронное выполнение, темпоральное ансамблирование в стиле ACT, обработку фрагментов в реальном времени (Real-Time Chunking) и базовый уровень с наивной асинхронной абляцией — за единой конфигурационной поверхностью.
Унифицированные модели для манипуляции роботами нацелены на то, чтобы оснастить единую политику как семантическими априорными знаниями предварительно обученных VLM, так и физической динамикой, осваиваемой через прогнозирование будущего. На практике существующие подходы, как правило, размывают семантику предварительно обученной базовой модели, страдают от интерференции между разнородными задачами и изучают прогнозирование будущего с нуля в пиксельном пространстве, оставляя неиспользованными априорные знания о динамике, заложенные в предварительно обученных генераторах видео. Мы представляем InternVLA-A1.5, которая строит политику на основе нативной базовой модели VLM, непрерывно обучающейся на задачах VQA и прогнозирования подзадач, и добавляет легковесный унифицированный эксперт для непрерывной генерации действий. Прогнозирование будущего переосмыслено как задача латентного запроса, где небольшой набор обучаемых токенов предвидения конденсирует релевантное задаче будущее в компактный латентный код под наблюдением замороженной предварительно обученной модели генерации видео, так что политика наследует априорные знания о динамике модели мира, не изучая генерации на уровне пикселей. На этапе вывода ветвь видео отбрасывается, сохраняя управление в реальном времени. Предварительно обученная на 1,2 млн роботизированных эпизодов и 3 млн мультимодальных образцов, InternVLA-A1.5 достигает наилучших совокупных результатов на всех шести симуляционных бенчмарках. В реальном мире сохраненная семантика обеспечивает наилучшее композиционное обобщение на связки команд, не встречавшиеся при обучении, а два этих решения вместе поддерживают выполнение задач на длинном горизонте.
Поиск научной литературы часто требует большего, чем извлечение статей по одному запросу: намерения пользователей не полностью определены, зависят от предпочтений и эволюционируют в процессе взаимодействия. Существующие поисковые агенты обычно полагаются на фиксированные конвейеры или неявные рассуждения только на основе языка, что делает их поисковые стратегии трудно контролируемыми, проверяемыми и улучшаемыми. Мы представляем PaperPilot — многопозиционный агент для поиска литературы, который рассматривает научный поиск как индукцию рабочего процесса. На основе референтной статьи и пользовательского запроса PaperPilot строит исполняемый DAG операторов поиска статей, включая поиск по ключевым словам, расширение цитирований, фильтрацию, ранжирование, переранжирование и извлечение доказательств. Затем используется обратная связь от пользователя для уточнения как запроса, так и самого рабочего процесса. Мы обучаем PaperPilot с помощью контролируемой имитации рабочего процесса и оптимизации предпочтений при контролируемых искажениях рабочего процесса. Эксперименты показывают, что PaperPilot-9B превосходит базового агента с инструментами Qwen3.5-9B при многопозиционном взаимодействии, повышая Hit@5 с 58,0 до 77,0, MRR с 47,5 до 59,4 и nDCG@10 с 26,8 до 32,5, при этом снижая количество ошибок выполнения рабочего процесса с 9,5% до 0%. Эти результаты показывают, что явные, редактируемые рабочие процессы поиска обеспечивают эффективный и контролируемый интерфейс для согласования агентов поиска литературы со сложными научными намерениями.
Рост кэша ключ-значение (KV) является основным узким местом при авторегрессивном декодировании, так как объем памяти и пропускная способность растут линейно с длиной контекста. Существующие методы вытеснения KV часто полагаются на статические эвристики или прокси-оценки, которые плохо предсказывают полезность будущих токенов и приводят к неустойчивому вытеснению при изменении релевантности. Для решения этой проблемы мы представляем KVpop, который обучает политику вытеснения KV с фиксированным бюджетом путем прямой супервизии решения "сохранить или удалить". Оценщик обучается на основе новой целевой функции будущего внимания, вычисляемой эффективно без материализации плотных карт внимания. Мы дополнительно вводим оценщик с отложенной памятью, который, уникально среди методов обучения вытеснению, откладывает оценку на фиксированное число шагов, чтобы использовать контекст ближайшего будущего. На математических задачах AIME и HMMT KVpop сохраняет 98% производительности полного внимания на Qwen3-4B при 75% сжатии KV-кэша и 97% при 88% сжатии, последовательно превосходя установленные базовые методы вытеснения. Qwen3-8B показывает еще более сильные результаты, достигая практически полной производительности учителя. Эти результаты показывают, что супервизия вытеснения с помощью сигналов будущего внимания снижает затраты памяти, сохраняя качество.
Мультивекторный поиск по изображениям и тексту сохраняет детальные визуальные признаки за счёт взаимодействия на позднем этапе с поиском максимального сходства, однако плотные токены на стороне изображения делают хранение и оценку дорогостоящими. Существующие методы сжатия токенов снижают эти затраты, но могут удалять или сворачивать признаки на уровне объектов и регионов, которые могут потребоваться будущим токенам запроса. Мы предлагаем SaMer — объектно-ориентированную структуру объединения токенов, которая сжимает токены после проекции на стороне изображения в K репрезентативных центроидов, сохраняя при этом исходный интерфейс позднего взаимодействия. SaMer использует аннотации объектов только во время обучения в качестве априорной информации для объединения, чтобы предотвратить смешивание между экземплярами, не требует истинных ограничивающих рамок или детекторов на этапе вывода и адаптирует только общий проекционный слой при замороженных магистралях зрения и языка. При K=64 SaMer удаляет более 93% токенов на стороне изображения и сокращает объём хранилища ColPali в 16,09 раза, одновременно улучшая показатель R@1 на наборах данных Flickr30K и MSCOCO. Эти улучшения объясняются тем, что объектно-ориентированное объединение сохраняет выбираемые запросом признаки объектов, которые могут быть удалены или свёрнуты при прореживании или свёртке только на основе признаков. SaMer также превосходит базовые методы сжатия и демонстрирует более сильное фразовое обоснование, что позволяет предположить, что эффективный мультивекторный поиск зависит не только от уменьшения количества токенов, но и от сохранения признаков, которые могут потребоваться будущим токенам запроса для выбора.
Диффузионные большие языковые модели (dLLM) генерируют текст путем итеративного устранения шума из маскированной последовательности, предлагая параллельную альтернативу авторегрессионным моделям, однако извлечение сильных рассуждений посредством пост-обучения остается сложной задачей: обучение с учителем является внеполитическим (off-policy) и страдает от экспозиционного смещения (exposure bias), в то время как обучение с подкреплением дает лишь разреженные, последовательно-уровневые награды и трудно применимо без вычислимых правдоподобий последовательностей. Он-политическая само-дистилляция (OPSD) предлагает многообещающую альтернативу, используя одну модель в качестве и ученика, и учителя для обеспечения плотного, токен-уровневого, он-политического контроля, но ее эффективность зависит от предоставления учителю привилегированной информации (PI) — обычно эталонного эталонного результата для конкретного примера, недоступного при инференсе — так что ученик в итоге дистиллирует слабую, лишенную PI консенсусную политику, которая дает мало улучшений в рассуждении dLLM. Мы представляем dOPSD, который вместо этого извлекает привилегию учителя непосредственно из собственной траектории устранения шума ученика, оценивая маскированные позиции с использованием более поздних, более декодированных шагов той же траектории, а не внешней метки, так что преимущество учителя возникает из собственного процесса декодирования модели; на Dream и LLaDA dOPSD улучшает как внутридоменное математическое рассуждение, так и внедоменную генерацию кода, превосходя базовые модели на основе обучения с учителем и он-политические методы.
Мы представляем первую многопользовательскую мировую модель для высокодинамичных сред, управляемых сложными физическими взаимодействиями. В то время как однопользовательские мировые модели рассматривают других агентов как часть среды, наша модель использует потоки действий нескольких агентов, обучаясь приписывать изменения в сцене правильному игроку и оставаться согласованной при произвольных комбинациях их действий. Мы изучаем эту проблему в игре Rocket League, где игроки соревнуются и сотрудничают в условиях быстрой, тесно связанной динамики. Обучившись на 10 000 часов игрового процесса, собранных с помощью общедоступных ботов, наша латентная диффузионная модель с 5 миллиардами параметров генерирует матчи с четырьмя игроками в реальном времени, выдавая 20 кадров в секунду на одном графическом процессоре Nvidia B200. Хотя модель обучена только на коротких клипах, ее развертывания остаются стабильными далеко за пределами горизонта обучения: качество распределения остается устойчивым вплоть до пяти минут — самого длинного горизонта, который мы измеряем, — и на практике мы наблюдаем, что развертывания продолжаются часами без признаков коллапса. Мы систематически исследуем ключевые проектные решения: видеокодек, генеративную цель и схему многопользовательского обусловливания. Кроме того, мы характеризуем, как поведение меняется с масштабом модели и данных, включая возникающие возможности и сохраняющиеся режимы сбоев. Кроме того, мы разрабатываем целевые оценки, которые исследуют физическое понимание модели, а не только визуальное качество. Чтобы поддержать дальнейшие исследования многопользовательских мировых моделей, мы публикуем наш набор данных, полную кодовую базу для обучения и инференса, а также живую демонстрацию.
Законы масштабирования предобучения показывают, что способность моделей предсказуемо улучшается с увеличением объема данных и вычислительных ресурсов. Однако обучение в реальных условиях после развертывания остается гораздо менее изученным. Проанализировав примерно 38 000 часов взаимодействия агента со средой в 134 реальных задачах, мы впервые, насколько нам известно, обнаружили, что общая производительность в процессе обучения в среде подчиняется логарифмическому сигмоидальному закону масштабирования с замечательно высокой точностью, достигая R² = 0,998. Кроме того, для разных поколений моделей мы обнаружили, что скорость обучения агента удваивается примерно каждые три месяца. Это открытие основано на EdgeBench — наборе из 134 реальных задач со сверхдлинными горизонтами, охватывающих научные открытия, разработку программного обеспечения, комбинаторную оптимизацию, профессиональную интеллектуальную работу, формальную математику и интерактивные игры. Каждая задача поддерживает не менее 12 часов непрерывной работы агента при богатой многоуровневой обратной связи и создана благодаря значительным усилиям экспертов. Мы публично предоставляем 51 задачу и нашу полную систему оценки, чтобы ускорить изучение того, как агенты обучаются на реальном опыте.
Мы предлагаем метод перцептивного потокового согласования (Perceptual Flow Matching, PFM) — простую, но эффективную схему для генерации за несколько шагов в моделях потокового согласования. В отличие от традиционной регрессии скорости в скрытом пространстве VAE, PFM осуществляет контроль потокового согласования в перцептивном пространстве признаков с помощью предварительно обученных перцептивных моделей. Это простое изменение значительно улучшает способность моделей потокового согласования к генерации за несколько шагов, сокращая количество шагов семплирования с 35–50 до 4–8 при сохранении качества генерации. В отличие от существующих методов ускорения и дистилляции, PFM не требует ни учительских моделей, ни вспомогательных сетей оценок и может быть интегрирован в стандартные обучающие конвейеры потокового согласования с минимальными модификациями. Обширные эксперименты по генерации изображений, видео и редактированию изображений показывают, что PFM стабильно дает высококачественные результаты, создавая при этом меньше артефактов по сравнению с существующими методами на основе дистилляции. Мы также демонстрируем, что перцептивный контроль смещает минимизатор регрессии от поиска среднего к поиску моды, направляя предсказания к модам на многообразии, которые остаются точными при грубой интеграции за несколько шагов. Наши результаты показывают, что стандартное обучение потокового согласования может естественным образом давать высококачественные генераторы за несколько шагов при контроле в подходящем пространстве представлений. Мы надеемся, что это понимание вдохновит будущие исследования задач, учитывающих представления, для эффективного порождающего моделирования.
Масштабирование предобучения, постобучения и вычислительных ресурсов на этапе тестирования стало центральной парадигмой для улучшения возможностей больших языковых моделей (LLM). В данной работе мы выделяем верификацию — способность определять корректность решения — как новую ось масштабирования. Для её реализации и демонстрации эффективности мы представляем LLM-as-a-Verifier — универсальный фреймворк верификации, предоставляющий детализированную обратную связь для агентных задач без необходимости дополнительного обучения. В отличие от стандартных судей на основе языковых моделей, которые побуждают LLM выдавать дискретные оценки для решений-кандидатов, LLM-as-a-Verifier вычисляет математическое ожидание по распределению логитов оценочных токенов для генерации непрерывных оценок. Такая вероятностная формулировка позволяет масштабировать верификацию по нескольким измерениям: (1) гранулярность оценивания, (2) повторное оценивание и (3) декомпозиция критериев. В частности, мы показываем, что масштабирование гранулярности оценивания улучшает разделение положительных и отрицательных решений, что приводит к более калиброванным сравнениям. Кроме того, масштабирование повторного оценивания и декомпозиции критериев последовательно даёт дополнительный прирост точности верификации за счёт снижения дисперсии и сложности. Мы также предлагаем экономичный алгоритм ранжирования для выбора наилучшего решения среди кандидатов, использующий непрерывные оценки верификатора. LLM-as-a-Verifier достигает современного качества на наборах данных Terminal-Bench V2 (86,5%), SWE-Bench Verified (78,2%), RoboRewardBench (87,4%) и MedAgentBench (73,3%). Помимо верификации, детализированные сигналы от LLM-as-a-Verifier могут служить прокси для оценки прогресса задачи. Мы создали расширение для Claude Code, позволяющее разработчикам отслеживать и улучшать собственные агентные системы. Наконец, мы показываем, что LLM-as-a-Verifier может предоставлять плотную обратную связь для обучения с подкреплением (RL), повышая эффективность выборки алгоритмов SAC и GRPO в задачах робототехники и математического рассуждения.
Аудиоинтеллект включает в себя понимание, рассуждение и генерацию как аудио, так и речи. В данной работе мы представляем Nemotron-Labs-Audex-30B-A3B (Audex) — унифицированную аудио-текстовую большую языковую модель (LLM), построенную на основе Nemotron-Cascade-2-30B-A3B, мощной текстовой LLM на архитектуре смеси экспертов (MoE). Audex использует простую унифицированную конструкцию с единственным декодером Transformer: аудиовходы кодируются и проецируются в пространство текстовых эмбеддингов, а текстовые токены и квантованные аудиотокены на выходе обрабатываются единообразно в процессе генерации. Такая архитектура обеспечивает сильное слияние аудио и текста, бесшовную мультимодальную генерацию, а также совместимость со стандартной инфраструктурой обучения и вывода LLM. Для обучения мы тщательно подобрали аудио-текстовые наборы данных, содержащие 157,4 млрд аудиотокенов и 320,5 млрд текстовых токенов. Мы применили многоэтапное контролируемое обучение на этих данных, за которым последовали каскадное обучение с подкреплением только на тексте и мультидоменная дистилляция на политике. Audex обеспечивает передовое понимание аудио, распознавание и перевод речи, синтез речи, генерацию аудио и преобразование речи в речь, сохраняя при этом очень убедительные способности к рассуждению, выравниванию, знанию, работе с длинным контекстом и агентные способности своей текстовой LLM-основы с минимальной регрессией или без неё. Мы публикуем контрольные точки модели для содействия открытым исследованиям.
Последние достижения в области диффузионных моделей видео позволили реализовать либо длительную генерацию одновидовых последовательностей с помощью темпоральной авторегрессии, либо короткий синтез многовидовых изображений через двунаправленное внимание. Однако создание длинных, непротиворечивых по множеству ракурсов видеороликов динамических сцен остается нерешенной задачей. В данной работе мы представляем MV-Forcing — фреймворк, который объединяет темпоральную и покадровую авторегрессию в рамках одной диффузионной модели путем введения четырехмерного геометрического моста между последовательно генерируемыми видами. Наша ключевая идея заключается в том, что авторегрессионная модель трехмерной реконструкции естественным образом выступает в качестве интерфейса между авторегрессионно создаваемыми видами. Имея готовый исходный вид, мы реконструируем его трехмерную структуру и формируем геометрический априор для следующей целевой точки обзора, который диффузионная модель затем уточняет до высококачественного видео. Чтобы расширить генерацию за пределы фиксированного временного окна учительской модели, мы внедряем совместный режим шумоподавления, при котором оба слота ракурса инициализируются шумом во время обучения, что обеспечивает темпорально неограниченную генерацию. Мы дистиллируем модель с помощью дистилляции согласования распределений (Distribution Matching Distillation) с пространственно-временным самопринуждением (Spatio-Temporal Self-Forcing), устраняя разрыв смещения экспозиции между обучением и выводом как для темпоральной, так и для последовательной по ракурсам авторегрессии. Обширные эксперименты как на синтетических, так и на реальных данных демонстрируют, что MV-Forcing создает геометрически согласованные многовидовые видео динамических сцен произвольной длины и с произвольным числом точек обзора, используя одну малоплаговую студенческую модель.
Агенты на основе больших языковых моделей всё чаще выполняют автономные действия через внешние инструменты, что порождает сложные и эволюционирующие риски для безопасности. Однако существующее тестирование безопасности ориентировано на нарушения, разработанные экспертами, а соответствующие результаты оцениваются по жёстко заданным правилам, что делает их дорогостоящими в расширении по мере развития агентов. Для решения этой проблемы мы представляем Vera — сквозную автоматизированную платформу тестирования безопасности, которая реализует принципы тестирования программного обеспечения для недетерминированных агентов с помощью трёхэтапного самоподкрепляющегося конвейера. Во-первых, управляемый литературой анализ непрерывно выявляет и структурирует возникающие риски в таксономии рисков безопасности, методов атак и сред выполнения инструментов. Во-вторых, комбинаторное составление по измерениям таксономии создаёт исполняемые сценарии безопасности, каждый из которых задаёт конкретную цель безопасности, программно сконструированное начальное состояние и детерминированный предикат верификации, основанный на наблюдаемых артефактах. В-третьих, адаптивное выполнение запускает гетерогенных агентов в изолированных песочницах, где управляющий агент направляет многошаговое взаимодействие на основе наблюдений времени выполнения, а проверяющие модули, основанные на фактических данных, оценивают результаты по состоянию среды и свидетельствам вызовов инструментов, а не по самоотчётам модели. Мы оцениваем Vera на четырёх производственных фреймворках агентов (OpenClaw, Hermes, Codex, Claude Code), выявляя существенные недостатки в безопасности: средний показатель успешности атак достигает 93,9% при многоканальных атаках. Мы также публикуем Vera-Bench, содержащий 1600 исполняемых сценариев безопасности, охватывающих 124 категории рисков в трёх средах выполнения. Эти результаты показывают, что модульная, исполняемая инфраструктура тестирования необходима для строгой и поддерживаемой оценки безопасности быстро развивающихся агентных систем в масштабе. Код доступен по адресу https://github.com/Yunhao-Feng/Vera.
Прогнозирование долгосрочного поведения направлено на вывод следующего действия пользователя на основе длинной исторической последовательности, что играет ключевую роль в области искусственного интеллекта. Развитие больших языковых моделей (БЯМ) открывает многообещающее направление для последовательного прогнозирования поведения, однако БЯМ сталкиваются с трудностями при индукции скрытых поведенческих паттернов и когнитивными искажениями, присущими модели, при решении задач долгосрочного прогнозирования. Предыдущие методы управления памятью следуют парадигме сжатия контекста, пытаясь решить эту задачу за счет снижения нагрузки на историческую последовательность, однако не устраняют основные проблемы. В данной статье мы предлагаем смену парадигмы, переосмысливая длинную историческую последовательность не как бремя, а как ценный ресурс для использования, и соответственно представляем PraMem, который проводит предварительную обработку длинной исторической последовательности для построения эмпирической памяти, служащей вспомогательным входом для точного долгосрочного прогнозирования поведения. Обширные эксперименты на различных задачах показывают, что PraMem достигает превосходных результатов по сравнению с предыдущими методами, а более глубокий анализ дает ценные сведения о механизмах и эволюции эмпирической памяти. Код: https://github.com/icip-cas/PraMem.
Большие языковые модели всё чаще работают с длинными контекстами, где KV-кэш становится основным узким местом по памяти: его размер растёт линейно с длиной последовательности и должен сохраняться на протяжении всего декодирования, что делает полное кэширование на GPU непомерно дорогим без сжатия. Существующие методы сжатия KV-кэша с трудом балансируют между эффективностью и точным сохранением контекста. Удаление токенов отбрасывает информацию, а семантическая группировка фиксирует решения о сжатии на этапе предзаполнения; ни то, ни другое не может восстановить детали на уровне токенов из сжатого отрезка, когда он становится актуальным во время генерации. В качестве решения мы предлагаем SeKV — семантический KV-кэш с адаптивным разрешением, который организует контекст в семантические отрезки, управляемые энтропией, и хранит их в иерархии памяти GPU-CPU без отбрасывания информации. Каждый отрезок хранит лёгкий вектор сводки на GPU для грубой маршрутизации и низкоранговый SVD-базис на CPU для восстановления на уровне токенов по запросу. Обученный механизм приближения выборочно расширяет отрезки, релевантные запросу, во время декодирования, обеспечивая точное извлечение без материализации полного KV-кэша на GPU. SeKV обеспечивает адаптивное восстановление на уровне токенов, сохраняя базовую LLM полностью замороженной и добавляя менее 0,05% обучаемых параметров. На четырёх бенчмарках SeKV превосходит сильнейший базовый метод семантического сжатия в среднем на 5,9%, одновременно снижая использование памяти GPU на 53,3% по сравнению с полным KV-кэшированием при контексте в 128K. Код доступен по адресу https://github.com/AmirAbaskohi/SeKV.
Прогнозирование динамики объектов (т.е. моделирование мира) является фундаментальной задачей роботизированного манипулирования, причем моделирование деформируемых объектов представляет собой особенно сложный случай из-за их многомерных пространств состояний и сложных материальных свойств. В настоящее время мировые модели подходят к этому через две различные парадигмы: обучение динамике в 2D пространстве пикселей или в более явном 3D геометрическом пространстве. Систематическое понимание их относительных сильных сторон и ограничений остается неясным из-за отсутствия разнообразных крупномасштабных реальных данных. Чтобы решить эту проблему, мы представляем Deform360 — крупномасштабный визуально-тактильный набор данных, включающий 198 предметов повседневного обихода, 1980 последовательностей взаимодействий и более 215 часов наблюдений с 41 камеры кругового обзора и двуручных тактильных захватов для регистрации как глобального движения, так и локальных деформаций, вызванных контактом. Используя новый безмаркерный визуально-тактильный 3D конвейер отслеживания для извлечения плотной геометрии и движения, мы систематически оцениваем современные мировые модели, сравнивая 2D видеомодели с 3D моделями частиц. Наконец, мы приводим предварительную демонстрацию, показывающую практическую применимость нашего набора данных, выполняя задачи планирования роботов на деформируемых объектах. Наш анализ выявляет ключевые представления о компромиссах между структурными априорными знаниями и масштабируемостью, обеспечивая надежный ориентир для будущих исследований в области обобщаемого моделирования мира, ориентированного на деформируемые объекты. Веб-сайт проекта: https://deform360.lhy.xyz
Воспроизведение уязвимостей на уровне репозитория является сложной задачей программной инженерии (ПИ): агент должен изучить кодовую базу, вывести грамматику ввода, достигающую уязвимого пути, создать доказательство концепции (PoC) и убедиться, что сбой исчезает в исправленной сборке. Современные LLM-агенты часто могут выполнять эти шаги, когда подход верен, но всё же терпят неудачу из-за выбора неверной стратегии. В данной статье утверждается, что стратегия, а не полная траектория действий, является правильной единицей обучения для таких агентов ПИ: она достаточно компактна для оптимизации, достаточно конкретна для управления выполнением и достаточно стабильна для хранения и повторного использования в разных попытках. Мы представляем Mastermind — двухконтурную структуру, которая разделяет переносимое обучение стратегии и опыт, специфичный для задачи. Обучаемый планировщик изучает повторно используемые стратегии воспроизведения уязвимостей с помощью SFT и контрольной точки GRPO, в то время как контур опыта ведёт записи стратегий, специфичных для задачи, которые направляют последующие попытки. Планировщик обучается независимо от исполнителя, что позволяет обучению стратегии улучшать несколько замороженных исполнителей без изменения их способности генерировать действия. Мы оцениваем Mastermind на CyberGym, используя 260 обучающих задач и 200 задач для оценки, не использовавшихся в обучении. С GPT-5.5 в качестве замороженного исполнителя Mastermind достигает 84,5% успешных прохождений, превосходя контекст PoC в открытом режиме (60,0%), выборку Best-of-8 (63,0%) и итеративное улучшение (77,0%). Тот же планировщик также улучшает показатели GPT-5.4 mini и GLM~5.1 с 45,0% и 58,5% до 60,0% и 71,0%. Эти результаты показывают, что изучение высокоуровневых стратегий является эффективным и переносимым механизмом для улучшения агентов ПИ масштаба репозитория.
В продольной клинической практике каждое рентгенологическое исследование грудной клетки интерпретируется с учетом предыдущих снимков пациента, и большая часть информации, передаваемой радиологом, касается изменений от одного визита к другому. Насколько нам известно, мы представляем первую схему выборки best-of-N без обучения для предварительно обученных генераторов отчетов о рентгенограммах грудной клетки, которая явно учитывает этот продольный переход от предыдущего состояния к текущему. Мы называем ее выборкой best-of-N с учетом переходов; каждый отчет разбивается на предложения и встраивается в неупорядоченное множество в R^d; каждая пара (предыдущее, текущее) сводится к вектору фиксированной размерности с помощью расстояния "множество-к-множеству", предназначенного для кодирования изменений между двумя множествами; а кандидаты оцениваются по косинусному расстоянию от их вектора перехода-кандидата до кэшированной базы эталонных векторов перехода из обучающих данных, агрегируемых как min или kNN. Мы реализуем эту структуру с использованием четырех направленных расстояний между множествами (сдвиг среднего, остаток новизны, ориентированный якорь Хаусдорфа и взвешенный по стоимости оптимальный транспорт) и оцениваем на когорте с многократными визитами AP-PA, выполняя вывод с тремя подсказками на трех генераторах "зрение-язык". Выборка best-of-N с учетом переходов превосходит случайную выборку во всех случаях, причем наибольший относительный прирост наблюдается в разделе "Заключение".
Всё чаще сервисы инференса LLM проксируют запросы клиентов к репликам движка, распределённым по всему миру. Политики балансировки нагрузки должны совместно учитывать такие факторы, как локальность KV-кэша, загрузка реплик и переменная задержка в сети, при оптимизации метрик, включая задержку и TTFT. Однако существующие системы учитывают лишь часть этих факторов в своей модели стоимости, что приводит к неравномерному распределению нагрузки и KV-кэша между репликами. Мы представляем GORGO — прокси-архитектуру, которая комплексно учитывает сетевую задержку, стоимость префилла и задержку в очереди с помощью настраиваемых параметров. Поскольку открытые наборы данных чатов, такие как LMSYS-Chat1M и WildChat-4.8M, не содержат данных с длинным контекстом и высокой повторной используемостью префиксов, мы выпускаем синтетический набор данных ART-Chat-2.5M, построенный на основе производственных метаданных с длинным контекстом. На окне настройки, основанном на ART-Chat-2.5M, эволюционные стратегии направляют параметры политики GORGO на непосредственную оптимизацию p95 TTFT. На отложенных окнах оценки мы фиксируем значения параметров, полученные в ходе настройки, и улучшаем p95 TTFT на 6.9–15.5%, а p95 сквозную (E2E) задержку — на 14.3–30.9% по сравнению с базовыми политиками балансировки нагрузки, такими как простая аффинность сеанса и кэш префиксов. Код и набор данных ART-Chat-2.5M доступны по адресу: https://github.com/Arcadia-Research-Team/GORGO.
Унифицированные мультимодальные модели (UMM) демонстрируют многообещающие возможности рассуждений с чередованием текста и изображений, однако эффективная оптимизация такой многопоточной генерации с помощью обучения с подкреплением (RL) остается открытой проблемой. Существующие подходы применяют RL исключительно к текстовым шагам, оставляя генерацию изображений на supervised-суррогатах, что препятствует распространению градиентов политики по всей чередующейся траектории через гетерогенные модальности. Это оставляет потенциал RL для UMM в значительной степени неиспользованным. В данной работе мы представляем BRAID (Bridging inteRleAved multI-modal reasoning as a unified Decision process) — простую структуру, которая рассматривает многопоточное текстово-изобразительное рассуждение как единый марковский процесс принятия решений (MDP), обеспечивая совместную оптимизацию текстовой и визуальной генерации с помощью единой, обоснованной цели RL. BRAID вычисляет совместное преимущество на уровне траектории и согласованно распространяет его как на текстовые токены, так и на пути денойзинга изображений, каждый из которых оптимизируется через свой собственный механизм градиента политики, специфичный для модальности. Для дальнейшего решения проблемы долгосрочного назначения кредитов BRAID использует судью на основе визуально-языковой модели (VLM), который оценивает каждое промежуточное изображение с точки зрения его полезности для рассуждений, обеспечивая плотную обратную связь на уровне шагов для усиления обучения на критических визуальных ветвях. Эксперименты на бенчмарках пространственного рассуждения и визуального восприятия показывают, что BRAID последовательно превосходит различные базовые модели, подтверждая, что единая формулировка MDP с направляющей визуальным мышлением является важной для эффективного мультимодального рассуждения.
Мы представляем работу команды AI Wizards, посвященную участию в EXIST 2026 по мультимодальной идентификации сексизма в мемах. Задача состоит из трех подзадач возрастающей сложности. Мы моделируем их иерархически как условное предсказание мягких меток на основе эмпирических распределений аннотаторов. Наша система отображает фиксированные зрительно-языковые представления Gemini Embedding 2 через легковесный Gated MLP, обученный с использованием дивергенции Кульбака–Лейблера и гомоскедастического взвешивания неопределенности. Наши решения заняли первое место по задаче 2.3 и четвертое по задачам 2.1 и 2.2 в официальных таблицах лидеров Soft-Soft. Код доступен по адресу: https://github.com/NLP-AI-Wizards/EXIST-2026
Модели «Видение–Язык–Действие» (VLA) приобретают широкие воплощенные способности благодаря крупномасштабному предварительному обучению, однако их обобщение остается гораздо более хрупким, чем у LLM и VLM. Распространенное средство — пост-обучение с помощью контролируемой тонкой настройки или обучения с подкреплением — улучшает производительность на конкретных задачах, но сужает способность к обобщению, которая делает предварительное обучение ценным. Мы выявляем ключевое узкое место: сбои VLA связаны не только с генерацией действий, но и с оценкой действий. Диагностическое исследование pass@k подтверждает, что замороженные VLA уже содержат компетентные поведения в своем выходном распределении, с общим уровнем успешности, возрастающим с 33% при pass@1 до 92% при pass@32. Вдохновленные этим, мы предлагаем SVA (Search, Value, and Act) — простую структуру, которая наделяет замороженные политики VLA осознанием долгосрочных последствий. SVA сначала использует поиск по дереву Монте-Карло в симуляции для полного исследования выходного распределения VLA и сбора разнообразных траекторий, аннотированных эмпирическими возвратами; затем эти знания дистиллируются в легковесную модель Q-значений, которая предсказывает ожидаемые последствия кандидатных действий; при развертывании замороженная VLA предлагает несколько кандидатов, а оценщик выбирает тот, который имеет наибольшее Q-значение с регуляризацией неопределенности, что не требует доступа к симулятору. Путем разделения предложения действий и оценки последствий SVA сохраняет обобщающую способность основы VLA, одновременно значительно повышая уровень успешности выполнения задач. Эксперименты на воплощенных бенчмарках показывают, что SVA последовательно улучшает обобщение на невидимых задачах и демонстрирует сильное масштабирование во время тестирования. Примечательно, что SVA позволяет VLA с 9 млрд параметров превзойти VLA с 27 млрд параметров на 7 пунктов при задержке вывода, меньшей на 27%, что предполагает, что масштабирование оценки во время тестирования более рентабельно, чем масштабирование размера модели.
Обнаружение депрессии на основе речи сжимает признаки из коротких аудиосегментов в одно решение на уровне говорящего — этап, называемый временной агрегацией, который редко изучается самостоятельно. В большинстве эталонных тестов фиксируется один самообучаемый кодировщик и один вручную выбранный слой, поэтому заявленное улучшение может отражать конвейер, а не сам метод агрегации. Мы представляем DEPOOL — контролируемый эталонный тест, который сравнивает шесть архитектур агрегации с шестью замороженными речевыми базовыми моделями на корпусах депрессии на английском и китайском языках, где каждая конфигурация обучается определять, какие слои базовой модели значимы, а не фиксирует их вручную. В полученной сетке из 72 конфигураций треть коллапсирует, предсказывая только один класс для каждого говорящего, — сбой, связанный как с базовой моделью, так и с методом, а архитектура, наиболее стабильная при однозатравочном запуске, становится ненадёжной при повторных запусках с разными начальными значениями. Устойчивость к базовой модели и начальному значению, а не средняя точность на одном конвейере, должна стать первостепенным критерием сравнения для временной агрегации в клинической речи.
Управляемые генеративные модели трехмерных медицинских изображений позволяют синтезировать объемы с заданными клиническими характеристиками, однако для этого требуются образцы, одновременно обладающие высокой точностью, нативной трехмерной структурой и строгим соответствием заданным условиям. Мы представляем CONFLUX — скрытую диффузионную модель для компьютерной томографии (КТ) грудной клетки: трехмерный вариационный автоэнкодер сжимает каждый объем, а трансформатор с выпрямленным потоком (rectified-flow transformer) генерирует данные в скрытом пространстве. Генерация обусловлена структурированными радиологическими метаданными (18 патологических находок, пол, возраст и ядро реконструкции) через адаптивную слоевую нормализацию. Модель превосходит сильные объемные базовые подходы по трипланарному расстоянию Фреше (FID 32,3 против 74,6 у MAISI), обеспечивая при этом прямой контроль над клиническими атрибутами. Для усиления этого контроля мы добавляем этап последующего обучения с подкреплением в режиме онлайн (оптимизация политики относительно группы, GRPO), который поощряет надежность восстановления классификатором запрошенных находок из каждого сгенерированного объема. Согласно оценке отдельного независимого классификатора, последующее обучение устраняет 47% отставания от уровня надежности реальных сканов. Мы публикуем модель и синтетический набор данных КТ грудной клетки объемом около 200 тыс. образцов с метаданными условий, охватывающими широкий спектр клинических находок.
Мы представляем SynCity 3000 — фреймворк для генерации 3D-сцен, которые являются глобально согласованными и при этом обеспечивают детальный контроль компоновки. Опираясь на способность современных генераторов изображений в 3D создавать сложные 3D-объекты на основе одного изображения, мы расширяем эту возможность до масштаба целых сцен, адаптируя генератор для применения в качестве сверточного оператора. Этого мы достигаем путем тонкой настройки модели на данных, имитирующих сцены, которые генерируются новым движком синтетических данных, предлагаемым нами для решения проблемы нехватки 3D-данных для обучения. Затем сверточный генератор применяется к диметрическому изображению всей сцены, созданному на основе пользовательского запроса, что позволяет получать 3D-сцены произвольного размера и сложности. На разнообразных запросах и компоновках SynCity 3000 создает крупные, согласованные и детализированные сцены, устраняя недостатки предыдущих подходов к генерации 3D-сцен.
Кроссмодальные соответствия между звуком и вкусом хорошо обоснованы в психологии и нейронауке, но практически отсутствуют в контентно-ориентированном поиске мультимедиа. Мы формализуем задачу предсказания вкуса по аудио как эталонный тест для поиска музыкальной информации на основе контента, используя верифицированный с точки зрения перцепции мультиисточниковый корпус. Сравниваются десять замороженных аудиокодеров из четырёх семейств HEAR под общей головой многозадачной регрессии с гейтированной поздней фузией в качестве настраиваемого варианта. Для оценки эффективности моделей вычисляются абсолютная ошибка и ранговая корреляция. Наиболее сильные системы предсказывают пять вкусов с макро-RMSE 0,134; на отложенной реальной музыке их ошибка составляет менее половины отклонения отдельного оценщика от консенсуса (RMSE 0,13 против 0,28), то есть модель отслеживает групповой консенсус точнее, чем средний человеческий оценщик, и значительно ниже предыдущего современного базового уровня (0,219). По абсолютной ошибке кодеры статистически однородны: один VGGish достигает того же результата, что и лучшая фузия, однако преимущество гейтированной поздней фузии ограничивается ранговой корреляцией (макро-Пирсон r 0,724 против 0,666). При операционализации в качестве индекса контентно-ориентированного поиска предсказанное вкусовое пространство ранжирует пул из 309 элементов значительно точнее, чем базовый CLAP-текст, работающий на уровне случайности; ридж-зонды и аудио-полосовое подавление (knockout) выявляют сильнейшие представления в соответствии с документированными связями звука и вкуса.
Планирование в реальном времени с использованием обусловленных действием моделей мира стало популярной парадигмой для воплощённого управления. Однако стандартная стоимость планирования оценивает кандидата исключительно по тому, насколько его прогнозируемое конечное состояние близко к цели, оставляя без проверки реализуемость промежуточных переходов: прогнозируемая траектория может выглядеть убедительно, тогда как реальное развёртывание среды отклоняется от неё. В данной работе мы предлагаем ACID — фреймворк для планирования в реальном времени, который вводит циклическую согласованность действий: действие, выведенное обратным образом из прогнозируемого перехода с помощью модели обратной динамики, должно восстанавливать то действие, на которое было произведено обусловливание. Мы сворачиваем эту пошаговую невязку в стоимость планирования с помощью масштабно-инвариантного адаптивного веса. На четырёх обусловленных действием моделях мира и шести задачах, охватывающих жёсткое и деформируемое манипулирование, шарнирное управление и визуальную навигацию, ACID последовательно улучшает планирование и достигает точности базового метода при существенно меньших вычислительных затратах на планирование.
Чтобы роботы могли надежно работать в коммерческих и промышленных приложениях, могут ли недавние достижения в области агентных систем кодирования объединить интерпретируемое программирование роботов с адаптируемостью к открытому миру, свойственной политикам без моделей? Мы сосредотачиваемся на «вариационной автоматизации» (ВА) — классе задач, характеризующихся бо́льшими вариациями геометрии и положения объектов по сравнению с фиксированной автоматизацией. Политики без моделей часто не могут преодолеть разрыв в надежности для задач ВА, которые должны выполняться постоянно и надежно в коммерческих и промышленных приложениях. Основываясь на предыдущих работах по планированию задач и движений (TAMP) и операционной системе для роботов (ROS), мы представляем Graph-as-Policy (GaP) — мультиагентную среду кодирования, которая генерирует направленные вычислительные графы с узлами восприятия, планирования и управления из модульной библиотеки открытых робототехнических навыков (MORSL). Затем GaP создает внутреннюю среду моделирования для параллельной отработки экземпляров задач с различными графами, чтобы итеративно улучшать структуру и параметры графа, повышая показатели успешности и производительность. Оценка на 8 новых открытых эталонных задачах ВА (4 в симуляции и 4 в реальном мире) показывает, что GaP может достигать показателей успешности, значительно превосходящих базовые подходы. Подробности, код и данные доступны онлайн: https://graph-robots.github.io/gap
Неконтролируемая слоговая токенизация направлена на изучение дискретных слоговых токенов, которые захватывают скрытую структуру, связанную с лингвистическим содержанием, из необработанной речи. Современные методы слоговой токенизации используют дистилляцию по схеме «учитель-ученик» предварительно обученной модели HuBERT для организации скрытых представлений речевых фреймов в слоговые сегменты. Однако при обучении с использованием функции перекрестной энтропии на уровне высказываний модель предсказывает идентичность говорящего, а не лингвистическое содержание, что снижает чистоту слоговых токенов. Для решения этой проблемы мы предлагаем слоговой токенизатор, свободный от влияния говорящего, который регрессирует возмущенные представления ученика к чистым целям учителя внутри блоков фиксированной длины. Экспериментальные результаты показывают, что предложенный метод достигает самых современных результатов в обнаружении границ слогов и кластеризации слоговых сегментов. Кроме того, языковая модель речи, обученная на наших слоговых токенах, достигает относительного улучшения на 7% в понимании синтаксиса и семантики по сравнению с моделью SpiRit-LM на уровне фонем.
Полуконтролируемая семантическая сегментация (SSSS) долгое время опиралась на один вопрос — каким псевдо-меткам доверять, — и отвечала на него всё более тщательной фильтрацией по достоверности. Фундаментальные основы меняют парадигму: при использовании учителя DINOv2 строгий порог уже сохраняет измеряемый 98%-чистый набор псевдо-меток, так что точность теперь resides не в фильтре, а в том, как пространство вложений структурировано по классам. Мы предлагаем PixCon — фреймворк чистоположительного пиксельного контрастирования. PixCon поддерживает банк памяти для каждого класса, в который допускаются только помеченные пиксели, уже правильно классифицируемые учеником, что гарантирует контаминационно-свободное положительное множество (ρ_F=0) по построению, в отличие от предыдущих контрастивных банков SSSS (ReCo, U²PL), основанных на псевдо-метках, отфильтрованных по достоверности. Это единственная ветвь над консистентным остовом, не добавляющая параметров на этапе вывода и не требующая порога, специфичного для банка. Анализ градиента контролируемой InfoNCE первого порядка объясняет, почему контаминация вредит: её ложноположительный член масштабируется как ρ_F/(1-ρ_F), что мы измеряем (0.018 на Pascal, 0.106 на ADE20K), а не предполагаем. На Pascal VOC, Cityscapes и ADE20K PixCon соответствует или превосходит сильный базовый метод UniMatch V2 на основе DINOv2 в протоколе с одним переключением при равных вычислительных затратах: он улучшает каждое начальное состояние Pascal-1/8 (прирост около +0.2 mIoU на начальное состояние), а его среднее по трём начальным состояниям достигает 87.90 — опубликованного значения UniMatch V2-B. Поскольку контаминация уже редка при учителях на основе фундаментальных моделей, наш анализ показывает, что гарантия ρ_F=0 действует в основном как устойчивость при ослаблении учителей, тогда как прирост точности обусловлен более чистой положительной супервизией, что делает чистоположительное контрастирование надёжным и малозатратным выбором по умолчанию для SSSS на фундаментальных моделях.
Высокопроизводительные научные установки, такие как Большой адронный коллайдер, зависят от фильтрации событий в реальном времени (триггирования) при жёстких ограничениях на пропускную способность, задержку и объём хранимых данных. На практике триггерные меню в значительной степени статичны и настраиваются вручную, что может приводить к субоптимальной работе по мере изменения условий детектора, наложения событий (pileup) и состава фона с течением времени. Мы формулируем задачу онлайн-настройки порогов как проблему последовательного принятия решений: агент обучения с подкреплением обрабатывает потоковые сводки последних скоростей срабатывания и чувствительных к сигналу признаков, обновляя пороги триггеров для максимизации эффективности отбора сигнала при отслеживании целевой скорости фона в пределах допустимого диапазона. Мы адаптируем оптимизацию политики с групповой фильтрацией (Group-Filtered Policy Optimization, GFPO) для управления потоковыми данными и вводим два варианта (GFPO-F, GFPO-FR), которые обеспечивают выполнение ограничения по скорости фона в процессе обучения. На тестовом стенде, имитирующем реалистичную эксплуатацию коллайдера, мы исследуем два репрезентативных триггера: триггер на полную поперечную энергию (H_{T}), чувствительный к изменению наложения событий, и триггер аномального детектирования (AD), основанный на ошибке реконструкции для редких или нестандартных сигнатур. На потоках Монте-Карло наш агент увеличивает долю временных интервалов, удовлетворяющих допуску, на 48% (H_T) и 28% (AD), с кумулятивным приростом до 2% в эффективности отбора сигнала на этих интервалах. При переносе с симуляции на реальные данные соударений (CMS Run 283408) тот же агент без дополнительной настройки достигает улучшения доли интервалов в допуске на 56% (H_T) и 28% (AD) по сравнению с базовыми методами, с дополнительным приростом эффективности сигнала по обоим триггерам. Насколько нам известно, это первая демонстрация управления триггерами на основе обучения с подкреплением на реальных данных соударений Большого адронного коллайдера. Код доступен по адресу https://github.com/Zixind/GFPO_LHC (см. репозиторий для получения подробной информации).