Ежедневно отобранные исследовательские статьи по ИИ с переводами
AI-агенты стали способны автономно выполнять короткие, четко определенные задачи. Однако существующие терминальные бенчмарки в основном сосредоточены на простых задачах, которые занимают минуты и оцениваются только по конечному результату. Такой подход упускает из виду промежуточный прогресс и частичные решения, давая разреженные сигналы награды и неполную картину возможностей агента. Мы представляем Long-Horizon-Terminal-Bench — терминальный бенчмарк из 46 задач на длинные горизонты, охватывающий девять категорий, включая воспроизведение экспериментов, программную инженерию, мультимодальный анализ, интерактивные игры и научные вычисления. Каждая задача имеет структуру, аналогичную Terminal-Bench, с эталонным решением или симуляционным движком, но дополнительно декомпозируется на детализированные градуированные подзадачи. Такая конструкция обеспечивает плотные промежуточные награды и частичный кредит, позволяя оценке учитывать не только то, достиг ли агент конечной цели, но и насколько далеко он продвинулся в открытых рабочих процессах. Задачи в Long-Horizon-Terminal-Bench обычно требуют сотен эпизодов и от нескольких минут до часов выполнения, что делает акцент на долгосрочном планировании, управлении длинным контекстом и итеративной отладке, а не на одноразовом решении задач. Мы оцениваем 15 передовых моделей и обнаруживаем, что агенты в среднем потребляют 9,9 млн токенов на задачу, примерно 231 эпизод и 85,3 минуты на выполнение одного запуска, что делает Long-Horizon-Terminal-Bench более требовательным, чем предыдущие терминальные бенчмарки. Даже самая сильная из протестированных моделей достигает 15,2% pass@1 при пороге частичного вознаграждения 0,95 и 10,9% при пороге идеального вознаграждения 1,0, тогда как средний показатель успеха по всем моделям составляет 4,3% и 1,7% при этих двух порогах соответственно. Эти результаты указывают на значительный потенциал для улучшения. Мы дополнительно анализируем режимы отказов и типичные ошибки и публикуем Long-Horizon-Terminal-Bench для поддержки будущих достижений в области терминальных агентов с длинным горизонтом.
Быстрый прогресс больших фундаментальных моделей в основном обусловлен предварительным обучением на крупномасштабных текстовых корпусах. Однако многие формы знаний передаются через визуальные представления, где рисунки, типографические уравнения и макеты страниц несут богатую информацию, которую невозможно точно или полностью передать только с помощью текста. Тем не менее, современные подходы к предварительному обучению отбрасывают эти визуальные подсказки, преобразуя визуально насыщенные источники, такие как документы и веб-страницы, в обычный текст для изучения языкового интеллекта. В данной статье оспаривается стандартное предположение о том, что языковые модели должны обучаться только на текстовых представлениях, и показывается, что визуальное предварительное обучение является масштабируемым обучаемым для интеллекта фундаментальных моделей. С этой целью мы проводим систематическое исследование парадигм неконтролируемого визуального предварительного обучения, которые напрямую используют визуальные документы без извлечения текста. На различных базовых архитектурах и эталонах визуальное предварительное обучение на одних и тех же базовых корпусах последовательно превосходит предварительное обучение только на тексте, предлагая эффективный путь к масштабируемому языковому интеллекту.
Движимое предсказанием следующего токена, NLP перешло от специализированных моделей к мощным универсальным фундаментальным моделям. Каков же эквивалентный катализатор, необходимый для создания универсальной модели в компьютерном зрении? В данной работе мы утверждаем, что крупномасштабная генерация видео по тексту служит мощной парадигмой предобучения для компьютерного зрения, предоставляя пространственно-временные априорные знания, выравнивание визуально-языковых представлений и масштабируемость, необходимые для общего визуального интеллекта. Мы представляем GenCeption, которая использует предобученный диффузионный бэкбон для генерации видео, чтобы определить прямую модель восприятия, способную выполнять различные задачи зрения, управляемые текстовыми инструкциями. Эмпирические результаты демонстрируют, что GenCeption достигает современного уровня производительности в широком спектре задач, включая оценку глубины, нормалей поверхности и позы камеры, сегментацию по выражениям и прогнозирование 3D-ключевых точек, часто сравниваясь или превосходя специализированные модели (например, DepthAnything3, SAM3, D4RT, VGGT-Omega, Sapiens, David, Genmo и Lotus-2). Кроме того, предобученный генерацией видео бэкбон превосходит альтернативные парадигмы предобучения (например, V-JEPA и Video MAE) в сопоставимых условиях. Важно отметить, что GenCeption демонстрирует предварительные свойства масштабирования данных и модели, а также исключительную эффективность по данным, достигая сопоставимой производительности с ведущими моделями, такими как D4RT и VGGT-Omega, при наличии от 7 до 500 раз меньшего объёма обучающих данных. Наконец, GenCeption также проявляет интригующее эмерджентное поведение: модель, обученная исключительно на синтетических видео с людьми, обобщается на реальные кадры и категории объектов, выходящие за пределы распределения (например, животные и роботы). Эти результаты свидетельствуют о том, что генерация видео — это не просто инструмент синтеза, а фундаментальный путь к созданию универсального зрительного интеллекта для физического мира. Страница проекта: https://genception.github.io
Крупные цели сложно достичь сразу, поэтому разумнее разбивать их на небольшие шаги. Мы представляем метод дистилляции политик с доверительной областью (Trust Region Policy Distillation, TOP-D), который преобразует notoriously нестабильную, высокодисперсионную дистилляцию по текущей политике (On-Policy Distillation, OPD) в стабильную парадигму обучения за счет динамического построения проксимального учителя. Теоретически мы устанавливаем строгую основу, демонстрируя, что TOP-D внутренне контролирует дисперсию градиентов. Предоставляя формальный глобальный анализ сходимости наряду с границей монотонного улучшения, мы математически формализуем надежность и стабильность общей динамики обучения. Эмпирически TOP-D значительно повышает стабильность обучения, эффективность использования выборки и итоговую производительность при решении задач математического рассуждения. Более того, TOP-D вносит нулевые дополнительные вычислительные затраты, позиционируя себя как многообещающую альтернативу устоявшейся парадигме OPD.
Пост-тренировочное квантование (PTQ) является широко распространённым методом сжатия больших языковых моделей (LLM) без повторного обучения. Существующие методы PTQ второго порядка, включая GPTQ, строят целевые функции квантования исключительно на основе статистики входных активаций, фактически предполагая, что все выходные каналы вносят равный вклад в реконструкционную целевую функцию на уровне слоя. Мы предлагаем KronQ — фреймворк PTQ, который ставит под сомнение это предположение, вводя ковариацию градиентов в процесс квантования. В рамках аппроксимации гессиана с разложением Кронекера потери при квантовании зависят как от ковариации активаций, так и от ковариации градиентов; KronQ использует это на двух взаимодополняющих уровнях. (1) KronQ вводит двунаправленную обработку некогерентности, расширяя существующее случайное вращение со стороны входных данных на выходное измерение с использованием ковариации градиентов, что уменьшает разброс значений весов как по входным, так и по выходным измерениям. (2) KronQ выводит новую метрику чувствительности для распределения смешанной точности между слоями, основанную на следах гессиана от градиентов и активаций. Примечательно, что в случае 2-битного квантования только весов для LLaMA-3-70B, в то время как GPTQ и GPTAQ расходятся или дают вырожденные квантования (перплексия более 2000 на WikiText-2), KronQ достигает перплексии 7,93.
Крупномасштабные модели типа «текст-в-изображение» являются привлекательными основами для плотного предсказания, поскольку предварительное обучение на генерации RGB обогащает семантическими, структурными и геометрическими априорными знаниями. Существующие генеративные и редакторские подходы повторно используют эти априорные знания, сводя плотное предсказание к генерации целевых данных: аннотации, такие как глубина, нормали, альфа-каналы, маски и тепловые карты, кодируются в латентное пространство VAE, обученное на RGB, и обратно декодируются как изображения-цели. Мы утверждаем, что такой подход наследует больше от интерфейса вывода генеративных моделей, чем требуется для плотного предсказания: в отличие от синтеза RGB, плотное предсказание требует пиксельно-корректных, соответствующих задаче полей данных на той же плоскости изображения, а не создания нового RGB-контента для рендеринга. Наше ключевое наблюдение состоит в том, что предварительно обученный DiT уже организует RGB-входы через решетку «патч→токен→патч» на плоскости изображения, так что каждый токен индексирует фиксированный выходной патч, каналы которого могут нести величины, соответствующие задаче, а не RGB-внешность. Мы реализуем это как ReChannel: сохраняем VAE-энкодер для входного распределения DiT, но отказываемся от декодера целевых данных, адаптируем замороженный DiT с помощью task LoRA и отображаем каждый токен в его пиксельное пространство размером p x p x K_t через общую токен-локальную линейную голову — около 33К параметров, без пространственного микширования. Используя FLUX-Klein, мы оцениваем модель на шести задачах плотного предсказания и более чем дюжине бенчмарков. Этот минимальный интерфейс устанавливает новый уровень передовых результатов в задачах извлечения матов без тримапа, глубины KITTI и реферирующей сегментации, а также сохраняет конкурентоспособность на нормалях, салиентности и позах. В сопоставимой конфигурации с 4B параметров он точнее и в 2,48 раза быстрее аналога, использующего редактирование и латентное декодирование: плотное восприятие может извлекать пользу из генеративного предобучения, не наследуя его выходной интерфейс.
Обработка длинных контекстов становится все более важной для больших языковых моделей (LLM), однако простое расширение контекстного окна не гарантирует эффективного использования длинных входных данных. По мере увеличения длины входных данных точность часто снижается, что указывает на то, что модели все еще испытывают трудности с выявлением и использованием свидетельств, наиболее релевантных вопросу. Перспективным способом улучшения использования длинных контекстов является обучение во время тестирования (TTT), которое рассматривает тестовый контекст как обучающий пример для адаптации параметров под конкретный экземпляр. Однако применение TTT ко всему длинному контексту чрезвычайно затратно, в то время как адаптация на случайно выбранных отрезках вносит значительный шум. Поскольку большинство отрезков в длинном контексте нерелевантны конкретному вопросу, обучение на них может даже ухудшить производительность базовой модели. Наше предварительное исследование показывает, что TTT очень чувствителен к качеству обучающих отрезков: на LongBench-v2 TTT на случайно выбранных отрезках вредит производительности, тогда как TTT на эталонных отрезках значительно ее улучшает. Руководствуясь этим, мы предлагаем простой метод — самоуправляемое TTT (S-TTT): перед адаптацией модель определяет отрезки-свидетельства, на которых ей следует учиться, и стандартная функция потерь языкового моделирования применяется только к этим выбранным отрезкам. На двух сложных бенчмарках для рассуждений с длинным контекстом, LongBench-v2 и LongBench-Pro, S-TTT повышает точность как для Qwen3-4B-Thinking-2507, так и для Llama-3.1-8B-Instruct, достигая до 15% относительного улучшения.
Тонкая настройка больших языковых моделей (LLM) для внедрения новых знаний сталкивается с критической проблемой: LLM могут быстро запоминать новые факты, но не способны использовать их для последующих задач рассуждения. Мы формализуем этот сбой как **разрыв между знанием и использованием**, характеризующийся разрывом в точности и временной задержкой между запоминанием и обобщением. Для понимания этого явления мы настраиваем LLM на неизвестные ранее знания и отслеживаем динамику пространственного проникновения знаний внутри модели с помощью нового метода вмешательства, названного самокоррекцией. Самокоррекция выявляет места активации, где перераспределение представлений существенно улучшает случаи неудачного обобщения. Эти результаты согласуются с гипотезой о несогласованности цепей знаний: запомненные представления могут существовать внутри модели, но не направляться к вычислительно эффективным слоям. Для демонстрации практической значимости данного диагностического вывода мы разрабатываем простую эвристическую стратегию, которая восстанавливает 58–75% эталонного потенциала в случае сбоя обобщения. Эксперименты проводятся в разных областях для проверки устойчивости этого вывода.
В данной работе мы решаем задачу долговременной памяти в панорамных мировых моделях, используя свойство ротационной эквивариантности омнидирекциональных представлений, где поворот можно рассматривать как неявное геометрическое преобразование. Исходя из этого подхода, мы предлагаем PanoWorld — метод, который сводит траектории камеры к трансляциям с фиксированными курсовыми углами как для моделирования текущих действий, так и для долговременной памяти посредством Плотного панорамного лучевого кондиционирования (DPRC) и Геометрически-осведомленной аугментации памяти (GMA). Затем вводится трехэтапный конвейер обучения для последовательной оптимизации каждого компонента. Для более качественной оценки физической согласованности в условиях крупномасштабных пространственных вариаций и разнообразного освещения, где существующие наборы данных отличаются относительной стабильностью, мы создаем World360 — крупномасштабный датасет, включающий как видеоклипы реального мира, собранные с помощью панорамных беспилотных летательных аппаратов, так и высококачественные симулированные клипы, сгенерированные в AirSim360. Обширные эксперименты на World360 демонстрируют эффективность PanoWorld, который значительно превосходит альтернативные методы. Наши модели, обучающий код и набор данных будут опубликованы в открытом доступе. Дополнительная информация доступна на странице проекта: https://lihaoy-ux.github.io/panoworld-page/.
Реалистичное и разнообразное моделирование дорожного движения имеет решающее значение для разработки автономного вождения. Однако существующие эталоны в основном поощряют реалистичность, и современные методы оптимизированы соответствующим образом, оставляя разнообразие недостаточно исследованным. Мы представляем Flow-ERD, мультиагентный симулятор, который совместно стремится к реалистичности и разнообразию. Его основой является метод «Потоковое согласование с учетом типа агента» (Agent-Type Aware Flow Matching, AFM), который объединяет мультимодальную выразительность потокового согласования с выполнением кинематики с учетом типа. Он сохраняет детализированное разнообразие, обеспечивая при этом согласованность движений с каждым типом агента. Второй этап — «Дистилляция с энтропийной регуляризацией» (Entropy-Regularized Distillation, ERD) — настраивает распределение развертывания в замкнутом контуре с использованием целевой функции обратного дивергенции Кульбака–Лейблера с энтропийной регуляризацией. Это смягчает ковариационный сдвиг, одновременно явно предотвращая коллапс в режимы с высокой плотностью. Мы оцениваем Flow-ERD с помощью метрики разнообразия, не основанной на логарифмировании, наряду со стандартными показателями реалистичности. Flow-ERD занимает первое место в тестовом эталоне WOSAC и доминирует на фронте Парето реалистичность–разнообразие среди воспроизводимых базовых линий. Страница проекта доступна по адресу https://seulbinhwang.github.io/flow-erd-project-page/{здесь}.
Медицина по своей сути мультимодальна: врачам необходимо синтезировать информацию из различных потоков данных. Однако разработка мультимодальных фундаментальных моделей ограничена ограниченным доступом к крупномасштабным высококачественным клиническим данным. Хотя PubMed Central (PMC) предлагает дополнительный источник экспертных данных в формате «изображение-текст», существующие ресурсы на основе PMC остаются ограниченными по достоверности, воспроизводимости и клинической валидации. Мы представляем MedPMC — автоматизированную, непрерывно обновляемую платформу, которая преобразует литературу с разрешительными лицензиями в высокодостоверную инфраструктуру для медицинских мультимодальных моделей. Применительно к 6,1 миллиона статей PMC платформа MedPMC отобрала 11 миллионов пар медицинских изображений и текстов. Оценка компонентов показала высокие результаты: начальный скрининг (F1 = 93,2), обнаружение многопанельных рисунков (F1 = 96,5), разделение рисунков (mAP = 89,8), разделение и выравнивание подписей (F1 = 81,4; ROUGE-L = 85,3) и классификация медицинских рисунков (F1 = 96,5). Ручная проверка пятью аннотаторами, трое из которых имели медицинскую подготовку, показала, что 95,3% изображений MedPMC являются медицински релевантными по сравнению с 19,7% в предыдущем наборе данных, полученном из PMC. На 26 тестах, охватывающих 11 специальностей, модель типа CLIP, обученная на MedPMC, улучшила средний показатель AUC при нулевом обучении на 7,1 процентного пункта по сравнению с самым сильным биомедицинским CLIP-базовым уровнем с аналогичной архитектурой, несмотря на использование менее половины пар «изображение-текст». В качестве кодировщика изображений в мультимодальной большой языковой модели она улучшила показатели медицинского визуального вопрос-ответа на 1,9 и 16,9 процентного пункта в двух тестах. На 10 524 дерматологических фотографиях из системы здравоохранения Yale New Haven Health System показатель Recall@5 при поиске изображений по морфологии улучшился на 11,7 процентного пункта. Эти результаты показывают, что курация литературы высокой достоверности укрепляет медицинские мультимодальные фундаментальные модели как в тестовых, так и в клинических условиях. Мы публично выпускаем платформу, корпус, тесты и предварительно обученные модели.
Сегментация и распознавание фонем являются тесно связанными задачами, однако в современных подходах они обычно моделируются по отдельности. Мы утверждаем, что фонетическая структура уже латентно присутствует в представлениях самоконтролируемых речевых моделей (S3M), и необходимо лишь направить их на решение обеих задач. Мы используем фонологическое активационное картирование на базе S3M (SPAM), которое отображает каждый фрейм представления S3M в вектор активаций фонологических признаков, таких как звонкость и назальность. Поверх SPAM мы вводим две простые, но эффективные легковесные головки предсказания, не требующие градиентного спуска: головку распознавания и головку сегментации. Наш метод требует менее минуты фонетических транскрипций и обобщается на ненаблюдаемые во время обучения фонемы. На разнообразном наборе данных наш подход демонстрирует высокую производительность как в сегментации, так и в распознавании.
Мы представляем Soofi S 30B-A3B — суверенную открытую фундаментальную модель на основе гибридной архитектуры Mamba Transformer со смесью экспертов (Mixture-of-Experts, MoE), предназначенную для немецкого и английского языков. Благодаря гибридной конструкции модель активирует лишь 3 из 30 млрд параметров на каждый токен, а кэш вывода остаётся практически неизменным при росте контекста, что обеспечивает решающее преимущество в пропускной способности над плотными моделями при развёртывании с длинным контекстом и высокой степенью параллелизма. Предварительно обученная на примерно 27 триллионах токенов с намеренно повышенным весом немецкого языка, Soofi S сопоставима с плотными моделями размером от 14 до 27 млрд параметров по совокупным показателям английских и немецких бенчмарков, достигая при этом наилучших совокупных показателей по коду на обоих языках среди 17 открытых базовых моделей. Модель превосходит все европейские суверенные базовые модели в нашем сравнении, включая те, что имеют гораздо больше активных параметров. Среди полностью открытых моделей Soofi S получает наивысшие оценочные показатели по английскому и немецкому языкам, опережая Olmo 3 32B и Apertus 70B. Soofi S была построена «с нуля» на базе German Industrial AI Cloud — суверенной высокопроизводительной ИИ-инфраструктуры, эксплуатируемой Deutsche Telekom в Мюнхене. Soofi S будет выпущена на условиях весьма разрешительного открытого доступа: веса, выбранные промежуточные контрольные точки, полный учёт данных по каждому источнику, гиперпараметры, а также обучающий и оценочный код. Там, где это допускают лицензии источников, артефакты построения данных распространяются по разрешительным лицензиям; коммерчески лицензированные источники документируются с указанием агрегированной статистики и точного состава смеси.
Визуально-языковые модели (ВЯМ) делают интерактивные цифровые музеи все более осуществимыми, соединяя 3D-оцифровку с исследованием артефактов на естественном языке. Однако в области культурного наследия, такой как древнегреческая керамика, надежная помощь ВЯМ ограничена двумя проблемами. Во-первых, интерпретация открытого типа требует увязывания мелкозернистых 2D/3D визуальных свидетельств со специализированными кураторскими знаниями, однако процесс поиска может вносить слабые источники и неверифицируемые ссылки. Во-вторых, когда доступные свидетельства неполны, зашумлены или неоднозначны, ВЯМ часто выдают уверенные, но необоснованные ответы вместо калиброванной неопределенности. Для решения этих проблем мы предлагаем VaseMuseum — легковесную и модульную мультимодальную агентную структуру для интеллектуальных цифровых музеев древнегреческой керамики. VaseMuseum объединяет интерактивный виртуальный музей с VaseAgent, который поддерживает как 2D-изображения, так и 3D-артефакты через мультимодальное восприятие, рассуждение с учетом 3D, извлечение внешних знаний и контроль надежности во время вывода. В частности, VaseAgent извлекает свидетельства из авторитетных веб-источников и музейных баз знаний, а контроль на уровне источников отбирает разнообразные и проверяемые свидетельства до генерации. Одновременно с этим контроль на уровне ответов проверяет сгенерированные утверждения на соответствие пулу свидетельств и поощряет нейтральные, ограниченные свидетельствами ответы при недостаточной или противоречивой поддержке. Кроме того, не требующий обучения механизм отбора в стиле GRPO отдает предпочтение ответам с корректными ссылками и калиброванной уверенностью без обновления базовой модели ВЯМ. Эксперименты в реалистичной симуляции цифрового музея показывают, что VaseMuseum улучшает валидность цитирования, уменьшает галлюцинации на запросах, требующих интенсивного использования знаний, и выдает более нейтральные ответы в условиях неоднозначности по сравнению с базовыми моделями ВЯМ с возможностью поиска.