Ежедневно отобранные исследовательские статьи по ИИ с переводами
Визуально-языковые модели (VLM) демонстрируют высокую производительность на бенчмарках понимания визуальных документов, таких как DocVQA, ChartQA и MMLongBench-Doc. Однако реальные документы сочетают множество факторов, включая длину, сложность макета, модальность и сложность вопросов, что затрудняет привязку сбоев модели к конкретным причинам. Мы представляем SynthDocBench — полностью синтетический бенчмарк для понимания визуальных документов с длинным контекстом, который систематически контролирует такие факторы, как длина документа, структура макета, модальный состав и тип вопроса. Бенчмарк построен с использованием комбинаторного дизайна: каждый фактор варьируется независимо в сгенерированных документах, что позволяет проводить контролируемый анализ поведения моделей. Документы генерируются сквозным образом с помощью конвейера на основе LLM для шести архитектурных шаблонов макетов, при этом 40% случайных замен предотвращают использование моделями ложных корреляций. Кроме того, SynthDocBench охватывает документы с длинным контекстом, обладающие значительно большей длиной и структурным разнообразием по сравнению с существующими бенчмарками. Оценив семь передовых VLM, мы выявили три режима сбоев, которые существующие бенчмарки не могут обнаружить: резкое ухудшение производительности с увеличением длины документа, систематическую позиционную чувствительность, при которой средняя треть документа оказывается самой сложной для пяти из шести моделей, причем пять из шести моделей демонстрируют отрицательный тренд «от раннего к позднему» (наибольшее снижение: 8,3 процентных пункта), а также нарушение понимания диаграмм в условиях длинных документов. Эти результаты позволяют предположить, что современные модели могут переобучаться на артефактах бенчмарков, а не достигать устойчивого понимания визуальных документов с длинным контекстом.
В данной работе мы предлагаем SpectraReward — функцию вознаграждения без дополнительного обучения, которая превращает предварительно обученные MLLM в готовые модели вознаграждения для обучения с подкреплением при генерации изображений. В отличие от подхода, требующего от MLLM оценки сгенерированного изображения или ответа на разбитые проверочные вопросы, SpectraReward измеряет, насколько хорошо исходная подсказка может быть восстановлена из сгенерированного изображения с помощью одного прямого прохода с обусловливанием изображением и принудительным обучением. В качестве вознаграждения мы используем среднее логарифмическое правдоподобие подсказки при условии изображения, напрямую применяя предварительно обученную способность MLLM к согласованию изображения и текста без использования меток предпочтений или дообучения модели вознаграждения. Кроме того, мы вводим Self-SpectraReward — частный случай для унифицированных мультимодальных моделей, в котором собственный модуль понимания политики служит моделью вознаграждения для её модуля генерации, образуя замкнутую структуру самоулучшения без внешних моделей вознаграждения или внешних знаний. Обширные эксперименты подтверждают эффективность SpectraReward в широком исследовании обучения с подкреплением при генерации изображений, охватывающем две диффузионные модели, три алгоритма обучения с подкреплением, девять архитектур MLLM-вознаграждений из четырёх семейств MLLM с числом параметров от 4B до 235B, а также пять тестов генерации текста в изображение, не входящих в распределение. Результаты показывают, что как SpectraReward, так и Self-SpectraReward значительно и стабильно улучшают качество генерации и превосходят предыдущие методы обучения с вознаграждением на основе MLLM. Дальнейший анализ показывает, что более крупные MLLM-вознаграждения не всегда лучше, в то время как Self-SpectraReward может сравниться с гораздо более крупными внешними моделями вознаграждения или превзойти их, что указывает на согласование вознаграждения и политики как ключевой фактор эффективного обучения с подкреплением при генерации изображений. Страница проекта: https://huangrh99.github.io/SpectraReward/
Визуальные генераторы превосходно справляются с рендерингом, но уверенно выдумывают то, чего не знают. Запросы пользователей безграничны, постоянно развиваются и имеют глубоко длиннохвостое распределение: новые персонажи, трендовые сущности, события после даты отсечения и многое другое. Это узкое место в знании мира носит структурный характер: генераторы обучаются на фиксированных корпусах, в то время как визуальный мир открыт. Мы создали SearchGen-20K и SearchGen-Bench, содержащие 20 839 промптов, охватывающих двенадцать категорий ошибок и двадцать две предметные области, в паре с предварительно выполненным мультимодальным корпусом SearchGen-Corpus-1M для поддержки автономных воспроизводимых исследований. На SearchGen-Bench передовые открытые генераторы набирают всего от 21 до 28 баллов из 100 — падение на 40 баллов, незаметное для существующих бенчмарков. Естественным решением является использование инструментов поиска, что позволяет осуществлять агентную визуальную генерацию. Однако мы обнаружили, что наивный поиск не справляется: он извлекает данные без разбора, внося шум в запросы, которые генератор уже обрабатывает. Мы прослеживаем коренную причину до зависящей от генератора, эволюционирующей границы знаний — разделения между тем, что генератор может усвоить в процессе обучения, и тем, что должно оставаться во внешнем контексте. Хотя эту границу трудно задать заранее, мы показываем, что ее можно обнаружить с помощью фреймворка совместного обучения «обучи-затем-ищи». Даже минимальная версия этого рецепта совместного обучения дает монотонное улучшение, закладывая основу для рекурсивного самоулучшения в визуальной генерации, способной удовлетворять запросы, основанные на знании мира. Мы публикуем полный набор данных, корпус для совместного обучения и поисковый корпус в качестве воспроизводимого инструментария для дополненной инструментами визуальной генерации, основанной на знании мира.
Современные модели искусственного интеллекта демонстрируют высокую производительность на многих установленных бенчмарках, однако по-прежнему терпят неудачи в задачах, которые люди считают почти тривиальными, таких как манипуляция строкой или рисование собаки с пятью ногами. Эти примеры позволяют предположить, что существующие бенчмарки могут недооценивать устойчивые слепые зоны в текущих системах. Мы представляем blind-spots-bench — бенчмарк, предназначенный для выявления таких слепых зон с помощью задач, которые кажутся простыми для человека, но остаются сложными для современного ИИ. Мы собираем необработанные вопросы от студентов курса по ИИ, очищаем их и аннотируем структурированными эталонными решениями, а также предлагаем таксономию задач, адаптированную для полученного набора данных из 235 образцов. Далее мы разрабатываем автоматизированный пайплайн оценки для широкого спектра моделей, включая языковые модели с открытыми весами и с закрытым исходным кодом, модели «язык-зрение» и модели генерации изображений. Наш анализ на blind-spots-bench показывает, что закрытые фронтирные модели могут существенно превосходить модели с открытыми весами, с разрывом даже около 10%, даже когда они достигают сопоставимой производительности на существующих бенчмарках. Более детальный анализ демонстрирует, что ни одна модель не доминирует во всех типах задач, а некоторые задачи остаются сложными для всех оцененных моделей. Эти результаты подчеркивают ценность blind-spots-bench как диагностического стресс-теста для выявления конкретных слабых мест в современных моделях.
Кодирующие агенты должны интегрировать результаты внешних инструментов в текущий процесс рассуждений — способность, которую стандартное предварительное обучение на коде слева направо раскрывает только в прямом направлении. Мы наблюдаем, что цикл «действие-наблюдение-продолжение» кодирующего агента структурно изоморфен месту вызова функции, где вызывающий связывает аргументы, вызываемый возвращает значение, вычисленное в другом месте, а последующий код потребляет это значение. Эта структура обусловленности существует в обычном коде в масштабе интернета. Мы используем её через промежуточное обучение с заполнением середины, учитывающее функции (FIM): это самообучаемая цель, которая маскирует функции, отобранные с помощью анализа графа зависимостей программы и двойного критерия сложности и выводимости. Мы проводим промежуточное обучение Qwen2.5-Coder-Instruct (7B/14B) и Qwen3-8B на очищенном корпусе из 2,6 миллиарда токенов, полученном из 968 репозиториев GitHub, а затем применяем существующие конвейеры постагентного обучения. Промежуточное обучение улучшает показатели SWE-Bench-Verified на +2,8/+3,0 для моделей 7B/14B и на +3,2 для Qwen3-8B; прирост на SWE-Bench-Lite составляет +3,7/+4,0/+5,4 для тех же моделей. Улучшение сохраняется на двух конвейерах постагентного обучения (R2E-Gym, SWE-Smith) и на базе, отличной от Qwen2.5 (Qwen3-8B с SWE-Lego). Помимо прироста внутри домена, промежуточное обучение также смягчает эрозию способностей, которую в противном случае агентное постагентное обучение вызывает в неагентском кодировании (например, LiveCodeBench) и не связанных с кодированием тестах на использование инструментов (tau-bench, BFCL): хотя корпус промежуточного обучения содержит только код Python, индуктивное смещение вызовов функций сохраняется после постагентного обучения и даёт последовательный прирост.
Кодовые агенты на основе языковых моделей (LLM) значительно продвинули автоматическое разрешение проблем в программном обеспечении, однако они по-прежнему крайне подвержены фактическим ошибкам, вызванным недостаточным пониманием репозитория. Современные методы пытаются смягчить это ограничение путём предремонтного исследования репозитория; тем не менее, их стратегии, ориентированные на исправление, исследуют репозиторий без выявления пробелов в знаниях агента, что часто приводит к получению неточного контекста, неспособного устранить лежащий в основе дефицит понимания. В данной статье мы предлагаем ACQUIRE — фреймворк на основе вопросов-ответов (QA) для разрешения проблем в программном обеспечении. По аналогии с тем, как опытные разработчики сначала осмысливают незнакомый код, прежде чем приступить к исправлению, ACQUIRE явным образом приобретает знания о репозитории до начала ремонта. Фреймворк разделяет приобретение знаний и генерацию патчей на два этапа: на первом этапе Вопрошатель и Ответчик совместно получают структурированные знания о репозитории, где Вопрошатель задаёт целенаправленные вопросы, а Ответчик предоставляет обоснованные доказательствами ответы посредством автономного исследования; на втором этапе Решатель использует полученные знания в формате QA для создания информированных патчей. Преобразуя неявные пробелы в знаниях в явное, фактологически достоверное понимание, ACQUIRE ускоряет этапы ремонта, требующие знаний, и позволяет достигать более точного разрешения проблем. Эксперименты на SWE-bench Verified показывают, что ACQUIRE стабильно превосходит репрезентативные предремонтные методы, повышая показатель Pass@1 до 4,4 процентных пункта при незначительном увеличении затрат и времени.
Существующие методы автоматической транскрипции музыки часто ограничены одноголосными записями или не справляются со сложными реальными музыкальными сведениями. Хотя в предыдущих работах применялись синтетические обучающие данные, полученные модели плохо обобщаются, что приводит к практически непригодным результатам транскрипции в реалистичных многоголосных условиях. В данной работе мы анализируем эффективность использования синтетических данных для предварительного обучения в сочетании с точной настройкой на реальных аудиозаписях и последующим обучением с подкреплением. Кроме того, мы вводим обусловливание наличием инструментов для настройки транскрипций. Наконец, мы публикуем MuScriptor — многоголосную модель транскрипции музыки с открытым весом, работающую на реальных записях из различных музыкальных жанров.
Основные визуальные кодировщики предварительно обучены на естественных изображениях и не могут быть эффективно применены к изображениям документов без адаптации, ориентированной на документы, поскольку плотный текст и мелкие штрихи символов требуют восприятия на уровне символов. Мы представляем MonkeyOCRv2 — модель с предварительным обучением визуального текста для анализа документов. Во-первых, мы создаем MonkeyDoc v2 — насколько нам известно, крупнейший корпус предварительного обучения для изображений документов, содержащий 113 миллионов изображений на 17 языках. Во-вторых, мы предлагаем стратегию предварительного обучения, которая совместно изучает генерацию изображения в текст и реконструкцию документов на уровне пикселей: первое выравнивает визуальные представления с текстовым содержанием, а второе сохраняет штрихи символов и детали макета. Проведены обширные эксперименты на пяти репрезентативных задачах анализа документов, включая распознавание текста, распознавание формул, обнаружение текста, обнаружение подделок документов и сегментацию перекрывающегося текста. Замена исходных кодировщиков на MonkeyOCRv2 последовательно улучшает производительность по всем пяти задачам. Наконец, мы подтверждаем его эффективность в качестве визуального кодировщика мультимодальных больших языковых моделей на более сложных задачах анализа и понимания документов. Будучи замороженным и объединенным с легковесной языковой моделью, он обеспечивает модель анализа документов на 0,7B параметров, которая устанавливает новый открытый передовой показатель на MDPBench — недавнем бенчмарке, охватывающем цифровые и сфотографированные документы на 17 языках, превосходя предыдущий лучший 3B dots.mocr на 2,8% абсолютно при визуальном кодировщике примерно в 11 раз меньше. Замороженный кодировщик также обеспечивает модель понимания документов, которая превосходит аналоги, построенные на CLIP, DINO и SAM, в восьми бенчмарках при одинаковых условиях обучения. Эти результаты показывают, что предварительное обучение визуальных моделей, ориентированное на документы, может служить самостоятельной основой для интеллектуального анализа документов.
Начиная с использования глубоких нейронных сетей для аппроксимации функции ценности состояния-действия, что привело к победе в одной из самых сложных игр, до алгоритмических прорывов, позволивших решать задачи без явного указания правил, исследования в области обучения с подкреплением были в центре выдающегося научного прогресса последнего десятилетия. В данной работе мы сосредоточиваемся на ключевых составляющих этого исследовательского прогресса и анализируем канонические парадигмы оценки и проектирования в обучении с подкреплением. Мы вводим теоретические основы законов масштабирования в обучении с подкреплением и показываем, что асимптотическая производительность алгоритмов обучения с подкреплением не имеет монотонной зависимости между рейтингами производительности и режимами данных. Мы проводим крупномасштабные эксперименты, и наши результаты демонстрируют, что линия исследований в области обучения с подкреплением в рамках канонических парадигм проектирования и оценки привела к неверным выводам. Наш анализ и результаты предоставляют ключевой анализ масштабирования, емкости и сложности глубокого обучения с подкреплением.
Агенты на основе больших языковых моделей (LLM) начинают автоматизировать проектирование машинного обучения (MLE) за счёт объединения планирования, выполнения кода, отладки и эмпирической обратной связи. Перенос этой способности на медицинскую визуализацию остаётся сложной задачей, поскольку каждая задача накладывает специфические для модальности требования к экспериментам, а также строгие требования к протоколам валидации и артефактам предсказаний. В данной работе мы представляем AMID — автономную мультиагентную среду для разработки моделей медицинской визуализации. AMID сначала предлагает метод планирования, обусловленного данными (Data-Conditioned Method Planning), который уточняет грубые пространства поиска на уровне задач до выполнимых, параллелизуемых направлений методов, основанных на анализе данных конкретной задачи и выполнимых ресурсах медицинской визуализации. Затем разрабатывается двухэтапная оптимизация с верификацией (Verification-Guided Two-Stage Optimization), которая переходит от широкого раннего исследования разнообразных направлений методов к избирательному использованию перспективных кандидатов, обеспечивая при этом строгую верификацию протоколов валидации, вычисления метрик и артефактов предсказаний на всём протяжении оптимизации. На 20 задачах по медицинской визуализации, охватывающих различные модальности и типы предсказаний, AMID превзошёл оцениваемые универсальные системы MLE, а по нескольким задачам приблизился к сильным решениям, разработанным человеком для конкретных соревнований, или сравнялся с ними. Эти результаты позволяют предположить, что AMID может превратить разработку моделей медицинской визуализации, специфичных для каждой задачи, из индивидуального ручного проектирования в агентный рабочий процесс, позволяющий создавать высокопроизводительные и проверяемые артефакты моделей для разнородных задач.
Данная работа представляет унифицированную формулировку для моделей компьютерного зрения, в которой различные формы визуальной информации, выходящие за рамки естественных изображений, такие как маски, карты глубины и другие структурированные визуальные сигналы, представляются в виде RGB-изображений, а общие визуальные задачи сводятся к общей проблеме редактирования изображений типа «RGB в RGB». В этой парадигме различные типы визуальной информации внутренне разделяют одну и ту же архитектуру кодирования и декодирования и параметры с естественными изображениями, что позволяет единой модели переносить знания между задачами через унифицированный визуальный интерфейс, аналогично тому, как языковые модели работают с текстом. Мы называем эту формулировку «RGB In and RGB Out» (RINO). Построенная на основе общего ядра редактирования изображений без тонкой настройки под конкретные задачи, RINO демонстрирует устойчивую и конкурентоспособную производительность с нулевым обучением как в задачах плотного понимания, таких как сегментация и оценка глубины (где мы унифицируем выходные данные как RGB), так и в задачах генерации с плотными условиями, таких как генерация изображения по позе (где мы унифицируем входные данные как RGB). Мы надеемся, что это исследование даст полезные идеи для создания общих унифицированных систем «зрение-язык», в которых различные визуальные задачи могут быть выражены, интерпретированы и решены через общий визуальный язык. Код доступен по адресу https://github.com/yangtiming/RINO.
Большие языковые модели, дообученные для прогнозирования, могут быть точными, но плохо калиброванными, а их цепочка мыслей (CoT) может не достоверно отражать свидетельства, стоящие за прогнозом. Мы исследуем, являются ли внутренние представления более прямым окном в оба этих аспекта. Работая с Eternis-Forecaster 8B на OpenForesight, мы обучаем зонды, объединяющие представления, на промежуточных активациях и обнаруживаем, что они достигают существенно лучшей калибровки; этот результат также подтверждается для GLM-4.7-Flash и GLM-4.5-Air. Затем мы оцениваем достоверность CoT с помощью абляции доказательств и отвлекающей инъекции: удаление влиятельного источника в промпте часто изменяет прогноз модели, оставляя след рассуждений нетронутым. Те же зонды функционируют как детекторы лжи: их активации отслеживают поведенческие сдвиги гораздо лучше, чем след рассуждений, и они также предсказывают направление изменения в 84% случаев, в том числе когда CoT скрывает влияние возмущения. Наконец, принудительный ответ показывает, что прогнозы в значительной степени фиксируются до начала рассуждений: единичный проход до рассуждений восстанавливает принятый ответ и уверенность, а направление вопросов на основе разброса этого предустановленного распределения ответов экономит 30–47% генерируемых токенов без потери точности. В совокупности эти результаты обосновывают использование зондирования внутренних представлений как практического инструмента для калибровки, аудита и триажа моделей-прогнозистов на основе языковых моделей и, в более широком смысле, моделей рассуждений.