Ежедневно отобранные исследовательские статьи по ИИ с переводами
Современный ИИ-агент зависит не только от своей базовой модели, но и от обвязки (harness), которая формирует промпты, управляет состоянием, вызывает инструменты и координирует выполнение. По мере эволюции моделей, API, сред и требований обвязку приходится постоянно модифицировать. Прежде чем внести такое изменение, разработчик или агент-кодировщик должен определить все участки кода, реализующие целевое поведение. Это сложно, поскольку производственные обвязки велики, тесно связаны, а их поведение распределено, тогда как запросы на модификацию описывают, что система должна делать, а репозитории организованы по файлам и модулям. Поиск кода, индексирование репозиториев и обработка длинного контекста облегчают инспекцию, но по-прежнему оставляют задачу ручного восстановления соответствия между поведением и кодом. Таким образом, локализация поведения является центральным узким местом в эволюции обвязки. Мы представляем Harness Handbook — ориентированное на поведение представление, автоматически синтезируемое из кодовой базы обвязки с помощью статического анализа и структурирования при помощи языковых моделей, связывающее каждое поведение с соответствующим исходным кодом. Мы также вводим метод прогрессивного раскрытия, направляемого поведением (Behavior-Guided Progressive Disclosure, BGPD), который ведёт агентов от высокоуровневого поведения к релевантным деталям реализации и проверяет кандидатные участки на соответствие текущему исходному коду. При решении разнообразных запросов на модификацию для двух обвязок с открытым исходным кодом планирование с помощью Handbook улучшает локализацию поведения и качество плана правок, используя при этом меньше токенов планировщика; наибольший выигрыш достигается на разрозненных участках, редко выполняемых путях и межмодульных взаимодействиях. Таким образом, эволюция сложных агентных систем зависит не только от генерации правок, но и от определения того, где эти правки должны быть внесены.
Мы представляем Boogu-Image-0.1 — семейство моделей с открытым исходным кодом для унифицированного мультимодального понимания и генерации, включающее варианты Base, Turbo, Edit и Edit-Turbo. Оно демонстрирует конкурентоспособную производительность в высококачественной генерации изображений по текстовому описанию, быстром логическом выводе, редактировании на основе инструкций и двуязычном (китайско-английском) рендеринге текста. Закрытые мультимодальные системы, такие как Nano-Banana-Pro и GPT-Image-2, достигают высокой производительности за счет системной интеграции, а не отдельной модели, однако их внутренние практики остаются в значительной степени нераскрытыми. В данной работе мы показываем, что целенаправленные улучшения в понимании модели, качестве данных и конвейерах обучения в сочетании с агентным масштабированием во время логического вывода могут существенно повысить производительность генерации и редактирования даже при крайне ограниченных вычислительных бюджетах. Всесторонние оценки показывают, что Boogu-Image-0.1 последовательно соответствует или превосходит другие модели с открытым исходным кодом по стандартным бенчмаркам и достигает результатов, приближающихся к ведущим закрытым системам. Примечательно, что это достигается с использованием всего 208,62 миллиона уникальных изображений. Теоретическая стоимость обучения базовой модели составляет всего около $400 000. Мы делимся практическими обсуждениями, которые, по нашему мнению, представляют ценность для широкого научного сообщества, и публикуем веса, код и рецепты под лицензией Apache 2.0 для развития открытой экосистемы унифицированного мультимодального понимания и генерации. Наш код доступен здесь: https://github.com/Boogu-Project/Boogu-Image.
Обучение с подкреплением на основе проверяемых наград без использования аннотированных человеком данных, часто называемое нулевым RL (zero RL), стало мощной парадигмой для извлечения цепочек рассуждений (chain-of-thought reasoning). Однако из-за вычислительных ограничений существующие исследования в основном ограничиваются небольшими моделями, оставляя динамику обучения и эмерджентные способности при масштабировании неизученными. Чтобы содержательно исследовать этот рубеж, мы стремимся получить от модели высококачественные паттерны рассуждений. Однако мы обнаруживаем, что наивное масштабирование часто страдает от плохой читаемости, избыточности токенов и отсутствия адаптивной глубины рассуждений. Для решения этих проблем мы представляем стабильный и эффективный конвейер обучения, включающий алгоритмические и системные оптимизации, такие как усеченная выборка по важности, коррекция соотношения обучения и инференса, а также управление смешанной точностью. Наши эксперименты дают три ключевых результата, подтверждающих «горький урок» масштабирования: (1) масштабирование до 1 триллиона параметров значительно повышает эффективность выборки и потолок производительности; (2) процесс обучения последовательно проходит через начальную фазу открытия, за которой следует фаза заточки; (3) модель спонтанно развивает продвинутые когнитивные поведения, включая антропоморфизм, структурированное форматирование, самопроверку, параллельное рассуждение и контекстную тревожность, делая созданные вручную эвристики избыточными. Оцененная на семи математических бенчмарках, модель Ring-2.5-1T-Zero достигает конкурентоспособной производительности. Кроме того, для оценки качества CoT за пределами правильности конечного ответа мы предлагаем структурированную схему оценки по трем измерениям: понятность, воспроизводимость и эффективность, где наша модель демонстрирует явные преимущества в создании структурированных и лаконичных трасс рассуждений. Делясь наблюдаемыми эмерджентными явлениями, мы надеемся предоставить сообществу более глубокое понимание поведения при масштабировании, особенно на уровне 1 триллиона параметров.
OpenClaw стал ведущим агентным фреймворком для автоматизации сложных задач, однако ему не хватает достаточной поддержки кроссплатформенного GUI-взаимодействия и хорошо развитого механизма самоэволюции. Эти недостатки ограничивают его адаптацию к разнообразным экосистемам устройств и препятствуют повышению производительности за счёт непрерывного обучения на основе опыта выполнения. Для решения этих проблем мы предлагаем парадигму «Познавай глубоко, действуй идеально» для персональных ассистентов, согласно которой накопленный опыт взаимодействия с пользователем и выполнения задач напрямую повышает точность и эффективность действий, объединяя когнитивное понимание и операционное выполнение. Основываясь на этой парадигме, мы представляем KnowAct-GUIClaw — новую структуру «Знай-Маршрут-Действуй-Размышляй», предназначенную для устранения недостатков OpenClaw в манипуляции GUI и преодоления ограничений кроссплатформенности и рекурсивного самосовершенствования. Во-первых, главный агент использует накопленный опыт взаимодействия и знания, относящиеся к задаче, для долгосрочного разложения и распределения задач (Знай). Во-вторых, подключаемый GUI-субагент с системой памяти на основе атрибуции опыта (Знай) и саморазвивающейся библиотекой навыков (Действуй), что обеспечивает seamless-миграцию между платформами и интеграцию по быстрому пути. В частности, этот фреймворк непрерывно сохраняет профили пользователей и обратную связь для повышения точности разложения задач и вызова инструментов. Обширные эксперименты на Android, iOS, HarmonyOS и Windows показывают, что KnowAct-GUIClaw достигает превосходной эффективности, точности и кроссплатформенной адаптируемости. В частности, GUIClaw с открытыми моделями Kimi-2.6 демонстрирует наилучшую производительность (64,1%) на бенчмарке MobileWorld для долгосрочных задач, превосходя все агентные фреймворки и закрытые агентные модели, такие как Seed-2.0-Pro и GPT-5.5. Кроме того, поддерживаемые нашим фреймворком осведомленная память и исполнительные навыки переносимы между различными базовыми моделями, улучшая показатели на 8,5% при использовании Kimi-2.6.
我们介绍OvisOCR2,这是一个拥有0.8B参数的文档解析模型。OvisOCR2被设计为端到端解析器:给定一个文档页面图像,它以自然阅读顺序生成Markdown表示,涵盖文本、公式、表格和视觉区域。我们构建了一个数据引擎,该引擎将过滤后的真实文档注释与合成页面相结合,后者的渲染图像和Markdown目标均源自同一HTML来源。训练方案包括监督微调、在具有多组件奖励设计的4B分支上的强化学习、对0.8B模型进行策略蒸馏以及模型融合。在OmniDocBench v1.6上,OvisOCR2达到了96.58的总体最优分数,使端到端模型首次登上此前由流水线方法主导的排行榜榜首,突显了端到端文档解析的潜力。在PureDocBench上,OvisOCR2也取得了最高Avg3分数75.06。除了这两个公开基准测试外,我们还在一个内部基准上对OvisOCR2进行了评估,该基准旨在覆盖更广泛的长尾和具有挑战性的场景。OvisOCR2在比较方法中取得了最佳总体性能,进一步证明了其泛化能力和鲁棒性。OvisOCR2可在https://huggingface.co/ATH-MaaS/OvisOCR2获取。
Защитные фильтры изображений обычно обучаются и оцениваются в условиях фиксированной политики безопасности, неявно трактуя безопасность как неотъемлемое свойство изображения. Реальные сценарии развертывания отличаются: одно и то же изображение может быть разрешено в одном продукте, ограничено в другом и вновь запрещено при изменении границ политики. Мы исследуем адаптируемую к политике защиту изображений (policy-adaptive image guardrailing), где модель должна решить, нарушает ли изображение текущую предоставленную политику, и обобщать на неизвестные ранее определения политик. Мы представляем PolicyShiftBench — комплексный тестовый набор, содержащий 2000 примеров, различающих политики, на основе 265 изображений. Каждое изображение в среднем снабжено 7,55 подсказками, обусловленными политикой, чтобы проверить, адаптируются ли модели к активной политике, а не полагаются на априорные представления об уровне безопасности изображения. Затем мы предлагаем PolicyShiftGuard — компактный защитный фильтр, обусловленный политикой, обученный с помощью двухэтапной методики, объединяющей SFT со случайной политикой (RP-SFT) и адаптацию по граничным парам политик (BP-Adapt). BP-Adapt обучает согласованные подсказки для одного и того же изображения и категории риска, используя стандартное наблюдение по меткам и потерю попарного сравнения, которая разделяет блокирующие политики и разрешающие политики. Эксперименты показывают, что существующие VLM и специализированные защитные фильтры остаются нестабильными при смене политик, в то время как PolicyShiftGuard существенно улучшает чувствительные к политике показатели. Модель с 7 млрд параметров достигает SOTA-результатов: средний F1 76,9 и средний PSS 72,1 на PolicyShiftBench, хорошо обобщается на UnSafeBench и SafeEditBench, а также улучшает компромисс между задержкой и производительностью за счет компактного выходного формата. Абляционные исследования подтверждают, что согласованные граничные пары «пропуск/блокировка» необходимы для стабильной адаптации к политикам.
Современные модели визуальной генерации способны создавать высококачественный контент, однако им не хватает связного восприятия пространственной структуры. Существующие методы генеративного синтеза новых видов обычно вводят явные геометрические априорные знания, которые обеспечивают пространственную согласованность, но по своей сути ограничивают обобщение при больших изменениях ракурса. Напротив, недавние интерактивные генеративные методы отдают предпочтение неявному моделированию сцены, предлагая большую гибкость за счет точного управления камерой и согласованности геометрии. В данной работе мы предлагаем MetaView — основанную на диффузии структуру синтеза новых видов по монокулярному изображению, позволяющую выполнять рендеринг при больших изменениях ракурса по одному снимку. Наша ключевая идея заключается в сочетании неявного геометрического моделирования с минимальными, но необходимыми явными 3D-подсказками: мы используем неявные геометрические априорные знания из сети прямого восприятия геометрии для регуляризации структуры без наложения ограничивающих реконструкционных конвейеров, одновременно применяя метрическую глубину для привязки генерации к метрическому масштабу. Такая архитектура позволяет MetaView достичь как согласованности геометрии, так и точной управляемости. Обширные эксперименты показывают, что в условиях сложных монокулярных изменений ракурса MetaView значительно превосходит существующие методы и демонстрирует превосходное обобщение. Наш код находится в открытом доступе по адресу https://github.com/KlingAIResearch/MetaView.
Модели мировых действий (WAM) улучшают обучение политик роботов за счет совместного моделирования действий и будущих визуальных наблюдений, используя эволюцию будущей сцены в качестве плотного контроля для генерации физически обоснованных действий. Однако распространенным подходом в существующих WAM является явная генерация будущих видео на этапе логического вывода, что приводит к значительным вычислительным затратам и препятствует развертыванию в реальном времени в замкнутом контуре. GigaWorld-Policy решает эту проблему с помощью формулировки, ориентированной на действия, где будущая визуальная динамика используется во время обучения, а на этапе логического вывода применяется декодирование только действий. Опираясь на эту основу, мы представляем GigaWorld-Policy-0.5 — улучшенную ориентированную на действия WAM, предназначенную для более эффективного управления роботами. В ходе предварительного обучения GigaWorld-Policy-0.5 использует смешанную стратегию моделирования мира, обусловленного действиями (AC-WM), и обучения WAM. Это укрепляет связь между визуальной динамикой и действиями робота, а также улучшает переносимость представлений действий для последующего обучения политикам. Для эффективного логического вывода GigaWorld-Policy-0.5 внедряет архитектуру Mixture-of-Transformers, которая разделяет моделирование визуальной динамики и генерацию действий на специализированные эксперты, сокращая активные вычисления при выводе только действий и достигая задержки вывода 85 мс на локальной конфигурации с RTX 4090. Кроме того, мы применяем агентный конвейер AutoResearch для систематического поиска конфигураций обучения, что позволяет более эффективно определять оптимальные экспериментальные настройки, сокращая время и ручное вмешательство, необходимые для настройки гиперпараметров. Эксперименты и абляции показывают, что GigaWorld-Policy-0.5 сохраняет преимущества обучения, связанные с будущей визуальной динамикой, одновременно повышая эффективность логического вывода для управления роботами.
Известно, что Vision Transformers (ViTs) демонстрируют высоконормовые выбросы патч-токенов, ухудшающие качество карт признаков, — проблема, эффективно решаемая с помощью токенов-регистров. Поскольку диффузионные модели всё чаще используют архитектуры трансформеров и переходят к обучению в пиксельном пространстве, они становятся ближе по форме к ViT, что ставит вопрос о том, полезны ли токены-регистры также для Diffusion Transformers (DiTs). В данной работе мы показываем, что DiTs принципиально отличаются от ViTs: они не проявляют выбросов патч-токенов, но всё же выигрывают от использования регистров. Интересно, что регистры более эффективны для DiTs в пиксельном пространстве, чем для DiTs в латентном пространстве. Анализируя промежуточные представления, мы обнаруживаем, что токены-регистры создают более чистые карты признаков при высоких уровнях шума, что может способствовать их эффективности при генерации в пиксельном пространстве. Мы также отмечаем, что современные архитектуры DiTs в пиксельном пространстве неявно включают механизмы, подобные регистрам, что может частично объяснять их высокую эмпирическую производительность. Основываясь на этих наблюдениях, мы предлагаем Register Guidance — метод, усиливающий вклад токенов-регистров, ответственных за улучшение визуальной структуры и согласованности.
Самоулучшающиеся автономные агенты переходят от исследовательских прототипов к развернутым системам. Основная цель — контролируемая эволюция, или адаптация, на основе опыта с минимальным или даже нулевым участием человека. Данный обзор рассматривает современные самоулучшающиеся агенты как адаптивные системы, преобразующие опыт в накопленные приросты способностей. Мы предлагаем системный фреймворк, представляющий современного агента как конфигурацию, связывающую фундаментальную модель с операционным каркасом, состоящим из промптов, памяти, инструментов и управляющей логики. В рамках этого фреймворка самоулучшение формализуется как самоиндуцированный оператор обновления, который получает и фиксирует обновления параметров модели или компонентов каркаса. Мы систематизируем предыдущие работы по цели обновления и сигналам, управляющим изменениями, затем рассматриваем приложения и обсуждаем оценку, завершая открытыми проблемами и будущими направлениями. Для удобства мы отслеживаем технические обновления на https://github.com/selfimproving-agent/awesome-Self-Improving-Agents.
Хотя недавние достижения в области 3D-генерации позволили добиться впечатляющего визуального синтеза, существующие методы часто полагаются на диффузионный контроль 2D без явных механизмов обеспечения геометрической согласованности, что приводит к пространственным галлюцинациям, таким как дублирование структур и несогласованная геометрия. Эти проблемы усугубляются в 4D-генерации, где поддержание согласованности между различными точками обзора и временной эволюцией создает дополнительные трудности, включая дрожание, мерцание идентичности и структурный дрейф. Мы представляем Hallo4D — унифицированную и модельно-независимую структуру для смягчения пространственно-временных галлюцинаций при генерации 3D и 4D контента. Hallo4D вводит парадигму «генерация-обнаружение-коррекция», которая использует большие мультимодальные языковые модели (LMM) для выявления и обобщения пространственных и временных несоответствий на основе многовидовых и многокадровых рендеров. Эти выводы направляют консенсусную оптимизацию согласованности в пространстве изображений, где селектор на основе LMM оценивает возможные коррекции посредством многомодельного голосования, не требуя переобучения или изменения архитектуры. Для дальнейшего улучшения временной согласованности и эффективности оптимизации Hallo4D включает семплирование ключевых кадров с учетом движения, инициализацию под руководством LMM и согласование внешнего вида. Кроме того, мы внедряем оптимизацию с учетом экспозиции и отбраковку видимости для повышения надежности при сложных точках обзора. Обширные эксперименты показывают, что Hallo4D стабильно превосходит сильные базовые модели в различных условиях 3D и 4D генерации, предлагая масштабируемое и обобщаемое решение для генерации контента с учетом согласованности.
Структурное прореживание — это аппаратно-ориентированный способ сжатия больших языковых моделей (LLM), однако он в основном проверяется на задачах распознавания с выбором ответа, в то время как те же сжатые контрольные точки могут разрушаться при свободной генерации, которая фактически требуется для развертывания. Два наблюдения объясняют этот разрыв. Во-первых, жадный показатель pass@1 почти исчезает после сжатия, но pass@k значительно восстанавливается при повторной выборке: полезные генерации не уничтожаются, а переводятся в разряд менее вероятных. Во-вторых, восстанавливаемый режим терпит неудачу в основном из-за повторяющихся суффиксов. Поэтому для восстановления следует обучать на собственных состояниях сжатой модели, соответствующих её текущей политике (on-policy), с плотным контролем на уровне токенов, что обеспечивает дистилляция по текущей политике (On-Policy Distillation, OPD) путём повторного использования модели до сжатия в качестве замороженного учителя. Однако длинные развертки по текущей политике тратят начальный бюджет восстановления на малоинформативные повторяющиеся суффиксы, замедляя снижение функции потерь. Чтобы уменьшить эту трату, мы предлагаем \shortopd — коротко-длинный график OPD, который выявляет подтверждённые учителем повторяющиеся суффиксы, считает выживший префикс эффективной длиной каждой развертки и распределяет будущие бюджеты разверток на те эффективные длины, которые политика может использовать в данный момент. В задачах математики, кода и открытой генерации \shortopd\ повышает оценку сжатой модели примерно в 9 раз по сравнению с её невосстановленным значением и в 1,6–4,4 раза по сравнению со стандартными рецептами восстановления (SFT без KD, KD и SeqKD), а также достигает результата фиксированного горизонта развертки в 8192 токена в пределах двух пунктов, используя лишь четверть времени обучения (8,5 против 35,9 часов) и на 71% меньше токенов развертки. Мы надеемся, что этот рецепт поможет продвинуть структурное прореживание за пределы маргинальных улучшений перплексии и тестов с выбором ответа — на шаг ближе к качеству генерации, пригодному для развёртывания.
По мере того как большие языковые модели (LLM) эволюционируют в автономных агентов, потребность в унифицированной инфраструктуре оценивания становится критической. Однако современные конвейеры оценивания остаются сильно фрагментированными и тесно связанными, что препятствует воспроизводимости и приводит к избыточным инженерным затратам. Для решения этой проблемы мы представляем AgentCompass — инфраструктуру с открытым исходным кодом, легковесную и расширяемую, предназначенную для оценивания агентов на основе LLM. AgentCompass организует процесс оценивания вокруг трёх независимых компонентов, а именно Benchmark, Harness и Environment, что позволяет гибко настраивать конфигурации без необходимости перереализации сложной логики выполнения. Кроме того, он включает отказоустойчивую асинхронную среду выполнения и комплексные инструменты анализа траекторий для прозрачной диагностики тонких режимов сбоев, таких как эксплуатация функции вознаграждения. Встроенная поддержка более 20 бенчмарков по пяти размерностям способностей позволяет AgentCompass предоставить сообществу масштабируемую и воспроизводимую инфраструктуру для продвижения исследований агентов.
Когда умный помощник должен заговорить без запроса? Непрерывное эгоцентрическое видео предоставляет богатый, постоянно меняющийся контекст, открывающий новую форму помощи: проактивную, а не просто реактивную. Однако существующие подходы либо пассивно ждут запросов пользователя, либо реагируют на каждое обнаруженное событие, не принимая во внимание историю пользователя, его текущую деятельность или то, будет ли помощь действительно уместна. Мы переосмысливаем проактивную помощь как проблему принятия решений с учетом контекста: агент должен не только воспринимать происходящее, но и анализировать накопленный временной контекст, чтобы определить, когда и стоит ли вмешиваться. Для этого мы представляем Vinci2 — проактивную систему эгоцентрической помощи, которая развивает бортовой помощник Vinci от реактивного реагирования к проактивности. Для оценки мы представляем EgoServe — первый крупномасштабный бенчмарк для проактивной помощи в непрерывном эгоцентрическом видео. EgoServe включает более 3000 сервисных экземпляров, организованных по четырем временным горизонтам памяти — от немедленных оповещений о безопасности до долгосрочного коучинга привычек — в 10 категориях услуг. Для моделирования мы предлагаем EgoMemo — агент без обучения с дополненной памятью, который поддерживает три взаимодополняющих представления памяти: многомасштабные временные сводки, семантический граф знаний и архивы визуальных вложений. На каждом временном шаге EgoMemo выполняет рассуждения с дополнением на основе поиска, чтобы определить, обоснована ли помощь, и если да, то генерирует контекстуально обоснованные ответы. Эксперименты показывают, что EgoMemo устанавливает надежные базовые показатели на EgoServe, оставаясь конкурентоспособным на существующих эгоцентрических бенчмарках. Наш бенчмарк и код доступны по адресу https://sitonggong.github.io/EgoServe-page/{Vinci2}.
Атрибуция сбоев для агентных систем на основе LLM, то есть определение того, какие шаги в траектории сбоя привели к неудаче задачи, имеет решающее значение для отладки и улучшения этих систем. Существующие подходы либо полагаются на конвейеры на основе подсказок (промптов), что требует больших вычислительных затрат, либо требуют дополнительного обучения на траекториях сбоев с аннотациями ошибок на уровне шагов, что дорого в сборе и трудно масштабируемо. Мы утверждаем, что практическая модель атрибуции сбоев должна быть легковесной и обучаемой без супервизии уровня шагов на данных о сбоях. С этой целью мы рассматриваем неконтролируемую атрибуцию сбоев, то есть обучение исключительно на успешных траекториях и идентификацию шагов с ошибками во время инференса при наличии траектории сбоя. Мы предлагаем OAT, которая формулирует эту задачу как обучение с одним классом с использованием нейронных управляемых дифференциальных уравнений, моделируя динамический паттерн успешных траекторий в латентном пространстве. Во время инференса каждому шагу в траектории сбоя присваивается оценка аномальности на основе его отклонения от динамики, изученной на успешных траекториях, которая затем используется для формирования набора шагов с ошибками. При обучении всего на 100 успешных траекториях эксперименты показывают, что OAT в 200–5000 раз быстрее базовых методов на основе подсказок и при этом стабильно превосходит их как на наборах данных из того же распределения (in-domain), так и на наборах из другого распределения (out-of-distribution), с приростом F1-меры на +20% и +7% соответственно, демонстрируя, что OAT является перспективным и эффективным направлением для диагностики сбоев агентных систем.
Дискретные диффузионные модели шумоподавления (DDM) недавно стали убедительной альтернативой авторегрессионному моделированию для дискретных данных, предлагая возможности параллельной генерации и итеративного глобального уточнения. В отличие от непрерывной диффузии, где пространство состояний фиксировано, DDM принципиально определяются способом построения дискретного пространства состояний: схемой токенизации, топологией словаря и доменно-специфическими структурными алфавитами. В данной работе представлена единая концептуальная рамка, которая рассматривает дискретные диффузионные модели через призму построения лежащего в их основе дискретного пространства состояний. В рамках этой схемы существующие формулировки, включая подходы на основе матрицы переходов, маскирования/поглощающих состояний и скоринга/отношений, предстают как различные реализации общего пространства проектирования. Данная рамка также выявляет общие компромиссы в проектировании между целями обучения, алгоритмами вывода, поведением при масштабировании, оптимизацией систем и протоколами оценки, предлагая несколько перспективных направлений для будущих исследований.
Агенты на основе больших языковых моделей (LLM) вышли за рамки генерации ответов и теперь выполняют многошаговые задачи, вызывая инструменты, наблюдая за результатами и итеративно принимая решения о следующем действии. Большинство агентных систем работают на настольных компьютерах или серверах, поддерживающих использование инструментов и автоматизацию задач. Мобильные устройства также являются важной средой для агентов, поскольку они широко доступны и содержат данные пользователей, датчики и приложения повседневного использования. Существующие мобильные агенты в основном управляют смартфонами через действия графического интерфейса пользователя (GUI), такие как нажатие, смахивание и ввод текста, которые часто образуют длинные, зависимые от интерфейса последовательности, не могут напрямую обращаться к возможностям устройства и затрудняют определение границ выполнения. Мы представляем PalmClaw — фреймворк для агентов с открытым исходным кодом, который работает нативно на мобильных телефонах и управляет сессиями, памятью, навыками, инструментами и циклом агента непосредственно на устройстве. PalmClaw предоставляет возможности устройства в виде инструментов с явными аргументами, структурированными результатами и четко определенными границами выполнения. Такая конструкция позволяет агентам напрямую использовать мобильные возможности, сохраняя при этом каждое действие явным и контролируемым. Эксперименты показывают относительное улучшение успешности выполнения задач на 11,5% и сокращение времени выполнения на 94,9% по сравнению с самым сильным базовым методом, при этом нагрузка на настройку ниже, а трассы иллюстрируют применение границ выполнения. Код доступен по адресу https://github.com/ModalityDance/PalmClaw.
Оптимизация долгосрочных агентов всё чаще опирается на механизмы рефлексии, в которых большая языковая модель (LLM) выступает в роли оптимизатора, диагностируя сбои агента и улучшая его политики. Однако реальные трассы выполнения сложно напрямую использовать для оптимизации: большие коллекции трасс часто избыточны и неоднородны, что делает оптимизацию неэффективной и склонной к переобучению на малозначимые сбои; в то же время каждая отдельная траектория содержит множество нерелевантных шагов, а наивные методы сокращения контекста, такие как усечение или скользящие окна, могут отбрасывать причинно значимые свидетельства и порождать вводящие в заблуждение сигналы оптимизации. Для разрешения этой дилеммы мы представляем STRACE (Structural TRajectory Analysis and Causal Extraction) — фреймворк, который формирует контексты оптимизации с высоким отношением сигнал/шум для более точной и эффективной оптимизации. На уровне пакетов STRACE выявляет паттерны сбоев, чтобы отфильтровать избыточные трассы и сохранить репрезентативные сбои; в рамках каждой выбранной трассы выполняется каузальная локализация на графе текстовых зависимостей, удаляющая непричинные шаги и определяющая истинный корневой модуль для оптимизации. Эмпирические результаты показывают, что STRACE значительно превосходит стандартные базовые методы фильтрации контекста. Примечательно, что на сложной задаче формальной верификации (VeruSAGE-Bench) он успешно оптимизирует агентов, разработанных экспертами-людьми, обеспечивая улучшение показателя успешности в 1,4 раза (с 42,5% до 58,5%). Код доступен по адресу https://github.com/moomight/STRACE .
Обучение с подкреплением со штрафом за длину может сокращать цепочку рассуждений, скрывая при этом влияние, которое направляет ответ модели. В наших экспериментах обучение со штрафами за длину не препятствует тому, чтобы вводящие в заблуждение подсказки направляли модели, хотя цепочки рассуждений моделей упоминают подсказку гораздо реже. Оценка по точности токенов сочла бы эти запуски успешными, поскольку они используют меньше токенов рассуждений с небольшой потерей точности; она упустила бы из виду, показывает ли оставшийся след то, что определяло ответ. Мы обучаем варианты Qwen3-4B и Qwen3-14B с различными целевыми длинами цепочек, затем оцениваем их с помощью вмешательств с предвзятыми подсказками на отложенных данных MMLU-Pro-R и четырех бенчмарках переноса. Сжатие резко сокращает токены рассуждений, сохраняет большую часть точности множественного выбора и оставляет влияние подсказок на уровне базового значения. При самом сильном целевом показателе нижняя граница достоверности падает до 63.1% от базового уровня для Qwen3-14B и до 69.4% для Qwen3-4B; сырой показатель, с которым монитор обнаруживает использование подсказки, снижается с 69% до 49% и с 60% до 48%. Чтобы отделить длину от содержания, мы случайным образом удаляем предложения из несжатых базовых цепочек, пока оставшийся текст не сравняется по длине со сжатыми. Даже после этого выравнивания по длине сжатые цепочки раскрывают подсказку на 7–35 процентных пунктов реже, чем базовые цепочки, которые мы случайным образом укорачиваем, для обоих размеров Qwen3 и всех пяти оценочных распределений. Таким образом, сжатие делает нечто большее, чем просто сокращение рассуждений: оно преимущественно удаляет сигналы, необходимые монитору для выявления того, что повлияло на ответ. В совокупности эти результаты выявляют границу сжатия-мониторируемости, в рамках которой более дешёвые рассуждения могут сохранять ответы, одновременно затрудняя обнаружение влияний, стоящих за ними.
AI-агенты для пентестинга становятся всё более убедительными в качестве систем наступательной безопасности, однако текущие бенчмарки всё ещё дают ограниченное представление о том, какие из них покажут наилучшие результаты в реальных целях. Существующие протоколы оценки проверяют и оптимизируют выполнение заранее заданных целей, таких как захват флага (CTF), удаленное выполнение кода, воспроизведение эксплойта или сходство траекторий, в упрощенных или узких средах. Эти инструменты полезны для измерения ограниченных возможностей, но они не отражают в полной мере сложность, открытое исследование и стратегическое принятие решений, необходимые в реальном пентестинге. В данной статье мы представляем практический протокол оценки, который смещает акцент с выполнения задач на подтвержденное обнаружение уязвимостей, что позволяет проводить оценку на достаточно сложных целях, охватывающих множество поверхностей атак и классов уязвимостей. Протокол объединяет структурированные эталонные данные (ground truth) с семантическим сопоставлением на основе LLM для выявления уязвимостей, двудольное разрешение (bipartite resolution) для оценки результатов в условиях реалистичной неопределенности, непрерывное поддержание эталонных данных, повторную и накопительную оценку стохастических агентов, метрики эффективности и выбор сокращенного набора тестов для устойчивого экспериментирования. Данный протокол расширяет текущее состояние дел, обеспечивая более реалистичное и операционно значимое сравнение AI-агентов для пентестинга. Для обеспечения воспроизводимости мы также публикуем экспертно аннотированные эталонные данные и код для предложенного протокола оценки: https://github.com/ethiack/ethibench.
Автономные системы беспилотных летательных аппаратов (БПЛА) всё чаще полагаются на мультимодальные большие языковые модели (МБЯМ) для работы в сложных реальных средах. Такие воплощённые сценарии требуют не только понимания окружающего пространства, но и поддержания согласованного представления о самом агенте. Однако существующие ориентированные на БПЛА подходы и бенчмарки остаются по большей части средо-центрированными, сосредоточенными в первую очередь на задачах пространственного понимания, при этом самосознание агента остаётся неявным. Для устранения этого пробела мы представляем SIS-Bench — бенчмарк для оценки воплощённого пространственного интеллекта в сценариях с БПЛА в рамках единой формулировки «self-in-space». SIS-Bench организует оценку по двум взаимодополняющим измерениям — пространство и самость, — а также по трехуровневой иерархии восприятия, памяти и рассуждения. Он содержит 4856 пар вопрос–ответ по 13 задачам, полученным из 1646 видеозаписей реальных полётов БПЛА с помощью конвейера построения, обусловленного задачами, и экспертной верификации. Обширные оценки показывают, что современные МБЯМ демонстрируют фундаментальные ограничения в моделировании динамических и агент-центрированных процессов. В частности, мы наблюдаем явный дисбаланс между пространственным познанием и самосознанием, а также прогрессирующее ухудшение производительности по мере перехода между когнитивными уровнями. Руководствуясь этими результатами, мы далее исследуем представление, учитывающее движение, которое включает динамику, связанную с агентом, посредством слияния оптического потока и визуальных признаков. Экспериментальные результаты показывают, что моделирование движения агента последовательно улучшает производительность восприятия и памяти — как в пространственном познании, так и в самосознании, — и обобщается на последующие задачи принятия решений БПЛА. Наши результаты подчёркивают важность самосознания для продвижения воплощённого пространственного интеллекта и предоставляют как новый бенчмарк, так и эмпирические свидетельства в пользу моделирования «self-in-space» с учётом движения.
Интерактивные симуляторы стали мощными инструментами для обучения воплощенных агентов и генерации синтетических визуальных данных, однако существующие фотореалистичные симуляторы страдают ограниченной универсальностью, программируемостью и скоростью рендеринга. Мы устраняем эти ограничения, представляя SPEAR: симулятор для фотореалистичных исследований воплощенного ИИ. В основе SPEAR лежит библиотека Python, которая может подключаться к любому приложению Unreal Engine (UE) и программно управлять им через модульную архитектуру плагинов. SPEAR предоставляет доступ к более чем 14 тысячам уникальных функций UE из Python, что представляет собой на порядок большее увеличение программируемых функций по сравнению с существующими симуляторами на основе UE. Кроме того, один экземпляр SPEAR может рендерить фотореалистичные изображения с разрешением 1920x1080 напрямую в массив NumPy со скоростью 73 кадра в секунду — на порядок быстрее существующих плагинов UE — одновременно предоставляя модальности изображений эталонной истины, недоступные ни в одном существующем симуляторе на базе UE (например, недиффузное разложение внутреннего изображения, идентификаторы материалов и параметры затенения на основе физических свойств). Наконец, SPEAR вводит выразительную модель программирования высокого уровня, которая позволяет пользователям задавать сложные графы работы UE с произвольными зависимостями данных между элементами работы и выполнять эти графы детерминированно в рамках одного кадра UE. Мы демонстрируем полезность SPEAR через разнообразную коллекцию примеров приложений: управление несколькими воплощенными агентами с различными пространствами действий (например, люди, автомобили и роботы) в нескольких проектах UE в реальных условиях; рендеринг фотореалистичных сред масштаба города; манипулирование системами процедурной генерации контента UE; рендеринг синхронизированных многовидовых изображений детализированных человеческих лиц; координация интерактивного совместного моделирования с физическим симулятором MuJoCo; и редактирование сцен с помощью естественного языка через AI-ассистента кодирования.
Мы представляем AffectFlow-DINO — многозадачную систему обучения для 11-го соревнования ABAW, расширяющую стандартную детерминированную архитектуру условным блоком rectified flow для моделирования присущей неопределённости поведения лица в реальных условиях. Вместо предсказания единственной оценки аффекта модель изучает условное генеративное распределение, что позволяет осуществлять учитывающие неопределённость предсказания "один ко многим" с помощью выборки Монте-Карло. Система совместно оценивает непрерывные валентность и возбуждение, классифицирует восемь выражений лица и обнаруживает двенадцать единиц действия по статическим изображениям лиц. Построенная на замороженной базовой модели DINOv3 ViT-S/16, обширные абляционные исследования показывают, что декодирование rectified flow последовательно улучшает детерминированные предсказания, особенно для оценки валентности-возбуждения (CCC-V +0.058). Мы также показываем, что пост-хок калибровка порога эффективно восстанавливает производительность на сильно несбалансированных редких классах (например, страх: с 3,8% до 33,1%) без переобучения. В сочетании с тонкой настройкой базовой модели и повторной настройкой потока финальная модель достигает P_MTL = 1,177, существенно превосходя официальный базовый показатель соревнования P_MTL = 0,45.
Языки с богатой статической семантикой, такие как Rust, обеспечивают более строгие гарантии для кода, генерируемого ИИ, однако их строгость усложняет генерацию. Готовые компиляторы могут предоставлять полезную обратную связь после генерации, но не направляют промежуточные шаги генерации, например, выполняемые в процессе авторегрессионного декодирования LLM. Ограниченное декодирование вмешивается раньше, отвергая недопустимые токены во время сэмплирования, но требует доступа к модели типа «белый ящик» и дорогостоящей перереализации для семантических ограничений. Мы представляем генеративную компиляцию — первый подход, позволяющий получать обратную связь от компилятора о частичных программах в процессе их генерации. Ключевым техническим устройством является силёр: легковесное преобразование, в основном основанное на синтаксисе, которое превращает частичные программы в полные, диагностируемые стандартными компиляторами. Оно спроектировано так, чтобы частичные программы, которые можно завершить, никогда не отвергались, при этом сохраняя достаточный контекст кода для раннего выявления реальных тупиков. Мы конструируем такой силёр для базового исчисления, подобного Rust, и доказываем, что он удовлетворяет этим свойствам, причём всё формализовано в Lean. Мы расширяем его до первого верификатора частичных программ для реального Rust. Мы оцениваем наш метод на сложных задачах написания кода на Rust на уровне репозиториев, как для фронтирных моделей типа «чёрный ящик», так и для моделей с открытым весом. Мы показываем, что генеративная компиляция сокращает количество некомпилируемых выходных данных и повышает функциональную корректность по сравнению со стандартной постгенерационной обратной связью. Это достигается за счёт обнаружения широкого спектра ошибок вблизи их источника и на ранних этапах генерации, что уменьшает каскады ошибок и обеспечивает адресную диагностику. В более широком смысле, генеративная компиляция — это шаг к превращению компиляторов в полноправных участников программирования с помощью ИИ, активных во время генерации, а не отдельной постгенерационной проверки.