Ежедневно отобранные исследовательские статьи по ИИ с переводами
Обучение с подкреплением на основе проверяемых вознаграждений (RLVR) — это мощный метод улучшения рассуждений языковых моделей, однако он дорогостоящ при повторении на каждой новой сильной модели, поскольку целевая модель должна генерировать множество прогонов в ходе обучения. По мере масштабирования моделей само пост-обучение становится узким местом. Мы исследуем альтернативу «от слабого к сильному»: запускаем RL на меньшей модели, где прогоны дешевле, а затем используем результаты этого RL для улучшения более сильной целевой модели. Прямая дистилляция слабого учителя после RL недостаточна, так как итоговая политика учителя смешивает полезные достижения RL с ограничениями меньшей модели. Мы предлагаем прямую онлайн-дистилляцию (Direct-OPD), которая переносит сдвиг политики, вызванный RL у учителя. Direct-OPD сравнивает учителя после RL с его же эталоном до RL и использует их лог-отношение как плотное неявное вознаграждение для ученика. Проще говоря, пара контрольных точек показывает, какие действия RL сделал для слабой модели более или менее вероятными, и Direct-OPD применяет этот сигнал на собственных онлайн-состояниях более сильного ученика. Это позволяет напрямую использовать сигнал наблюдения RL от слабой модели без запуска RL с разреженным вознаграждением на целевой модели. Эмпирически Direct-OPD последовательно использует более слабых учителей для улучшения более сильных целевых моделей; в частности, она повышает результат Qwen3-1.7B с 48,3% до 58,3% на AIME 2024 всего за 4 часа на 8 GPU A100. Метод превосходит прямой RL с попарным выравниванием шагов и позволяет последовательно комбинировать несколько сдвигов политики. Наши результаты показывают, что результаты RL можно повторно использовать между масштабами моделей в виде сигналов неявного вознаграждения, а не только как финальные модели для имитации.
Фундаментальные модели визуально-языковой навигации (Visual Language Navigation) направлены на объединение глубокого рассуждения для пространственных решений с широкой универсальностью, необходимой для разнообразных воплощённых задач. Современные подходы обычно реализуют такую интеграцию с помощью монолитных политик, отображающих наблюдения непосредственно в действия, однако они часто страдают от дрейфа координат и плохой обработки длиннохвостовой семантики. Кроме того, такие отображения, работающие по принципу «чёрного ящика», лишены интерпретируемости, что препятствует одновременному достижению обобщённости, надёжности и прозрачности. Мы представляем ABot-N1 — шаг в сторону общей фундаментальной модели визуально-языковой навигации, которая решает эти проблемы путём разделения когнитивных процессов и управления с помощью медленно-быстрой архитектуры, направляемой двойными визуально-языковыми сигналами. В частности, медленный визуально-языковой рассуждатель выполняет явное рассуждение по цепочке мыслей (Chain-of-Thought), одновременно формируя пиксельную цель. Этот компактный набор опорных точек в пространстве изображения служит универсальным интерфейсом для различных задач, включая достижение целевой точки (point-goal), целевого объекта (object-goal), точки интереса (poi-goal), следование инструкциям (instruction-following) и следование за человеком (person-following). Впоследствии быстрый эксперт по действиям использует как текстовые подсказки, так и пиксельное управление для генерации непрерывных путевых точек на собственной частоте управления. Связывая высокоуровневые намерения и низкоуровневое управление через пиксельные привязки в сочетании с явными лингвистическими следами, наш подход обеспечивает надёжную, обобщаемую и интерпретируемую навигацию как в симуляции, так и на реальных эталонных тестах. ABot-N1 устанавливает новые рекорды, достигая значительных улучшений в навигации городского масштаба: повышение точности прибытия в точку интереса (POI) на 35,0% (до 77,3%) и достижение успешности (SR) 95,4%/92,9% в сложных indoor- и outdoor-сценах. Модель также сохраняет превосходную надёжность в задачах достижения объектов, следования за человеком и следования инструкциям. Новые эталонные тесты Point-Goal/POI-Goal публикуются в открытом доступе для продвижения области навигации городского масштаба.
Недавние системы VLM и VLA улучшили роботизированное восприятие и прогнозирование действий, однако долгосрочные воплощенные агенты по-прежнему требуют общего уровня выполнения для рассуждений, памяти, использования инструментов, верификации и исполнения на разных воплощениях. Мы представляем ABot-AgentOS — общую операционную систему для роботизированных агентов, которая располагается над низкоуровневыми контроллерами и предоставляет слой рассуждений агента для планирования с учетом сцены, изолированного по контексту выполнения навыков, многоэтапной верификации, мультимодальной памяти и взаимодействия между периферией и облаком. Для оценки подобных систем мы вводим EmbodiedWorldBench — исполняемый эталонный тест, включающий 16 сцен (внутренних, наружных и гибридных), четыре уровня сложности и более 200 задач, охватывающих навигацию, поиск объектов, диалог с NPC, динамические события и оценку на основе трасс. ABot-AgentOS также вводит универсальную мультимодальную графовую память — постоянный субстрат, привязанный к источникам, который преобразует диалог, визуальные наблюдения, пространственный контекст, временные отношения и трассы задач в типизированные узлы и ребра. Цикл самоэволюции, движимый сбоями, превращает диагностированные ошибки памяти в управляемые эволюционные активы времени выполнения, которые продвигаются только в более поздние разделы оценки, предотвращая утечку истинных значений в текущем разделе и обеспечивая непрерывное улучшение. На начальном подмножестве EmbodiedWorldBench ABot-AgentOS превосходит базовый алгоритм с одним контроллером как по успешности задач, так и по завершению целей. На эталонных тестах памяти статическая версия ABot-AgentOS достигает 87,5 на LoCoMo, 59,9 на OpenEQA EM-EQA, 88,6 на Mem-Gallery и 76,5 Acc@All на NExT-QA; самоэволюция дополнительно улучшает показатели LoCoMo до 88,7, OpenEQA до 60,4 и Mem-Gallery до 89,0. Эти результаты свидетельствуют о том, что общий слой агентной ОС может улучшить долгосрочное выполнение в воплощенной среде, одновременно обеспечивая постоянную проверяемую память для непрерывного взаимодействия.
Существующий объемный захват динамических движений человека достигает высокой точности при использовании плотных массивов камер. Однако в реальных сценариях доступно лишь несколько камер с малым перекрытием, что снижает качество выходных данных и оставляет большие области невидимыми. Современные методы 4D-реконструкции были сосредоточены на условиях малого перекрытия, однако они всё ещё создают заметные артефакты в плохо наблюдаемых областях. Модели диффузии видео появились как ещё один вариант, но они демонстрируют геометрически несогласованные результаты для людей. Для преодоления этих ограничений мы предлагаем StudioRecon — конвейер, который реконструирует 4D-сцены с людьми из разреженных камер с малым перекрытием путём разделения фона и людей. Мы уплотняем контроль фона, синтезируя сотни управляемых камерой новых ракурсов с помощью модели диффузии видео. Мы также надёжно инициализируем деформируемые гауссовы модели людей с помощью перекрёстной ассоциации идентичностей и триангулированной подгонки многовидовых ключевых точек. Наконец, наш рекурсивный модуль улучшения с внедрением адаптивной к движению согласованности гармонизирует составной результат, тем самым дополнительно избегая оставшихся артефактов. Мы достигаем передового синтеза новых ракурсов на четырёх реальных наборах данных и демонстрируем приложения, такие как визуализация новых траекторий и замена людей.
Персональные ИИ-ассистенты на мобильных и носимых устройствах непрерывно воспринимают повседневную жизнь пользователей через визуальные и аудиопотоки. Однако ответы на запросы о прошлом опыте требуют легковесной мультимодальной памяти, способной постоянно накапливать, организовывать и извлекать долгосрочные переживания, что остается сложной задачей. Для решения этой проблемы мы представляем LightMem-Ego — легковесную потоковую систему мультимодальной памяти для помощи в повседневной жизни. Система непрерывно захватывает эгоцентрические визуальные и аудиопотоки, выравнивает их на общей временной шкале и организует в иерархическую память, состоящую из текущей, краткосрочной и долгосрочной. По запросу пользователя LightMem-Ego динамически направляет извлечение на соответствующий уровень памяти и генерирует ответы, основанные на мультимодальных доказательствах. Демонстрация может быть развернута на смартфонах и ИИ-очках, поддерживая поиск объектов, воспроизведение разговоров, обобщение жизненного опыта, обнаружение рутинных действий и персонализированную помощь. Код доступен по адресу https://github.com/zjunlp/LightMem-Ego.
Большие языковые модели (LLM) достигли выдающихся результатов в решении задач школьного и олимпиадного уровня по математике, однако их возможности в области высшей математики остаются слабо изученными. Существующие тестовые наборы данных имеют ограничения как по охвату, так и по детализации оценки: они охватывают лишь небольшое число дисциплин и зачастую полагаются на проверку правильности итогового ответа или грубые оценки, оставляя без должного внимания валидность процесса рассуждений. Для устранения этого пробела мы представляем AdvancedMathBench — набор тестов, предназначенный для оценки способности к математическим рассуждениям продвинутого уровня. Его основная часть, ProverBench, содержит 296 задач, охватывающих уровни бакалавриата и докторского квалификационного экзамена. Для обеспечения надёжной оценки доказательств мы разработали специализированный автоматический конвейер верификации, обученный на крупномасштабных экспертных аннотациях, который выдаёт как вердикты о правильности, так и детальные оценки ошибок в доказательствах; на отложенных траекториях доказательств этот конвейер демонстрирует высокую согласованность с экспертами-людьми. Мы также представляем VerifierBench, состоящий из 888 траекторий доказательств, сгенерированных моделями, в паре с экспертными эталонными данными, предназначенный для оценки способности моделей правильно судить о валидности доказательств и предоставлять обоснованные рациональные обоснования проверки. Эксперименты показывают, что AdvancedMathBench остаётся сложным для передовых моделей. В задаче генерации доказательств лучшая модель, GPT-5.5-xhigh, достигает лишь 75,8 и 66,1 на выборках UGD и QE соответственно, что указывает на значительный потенциал для улучшения в области построения доказательств высшей математики. В задаче верификации доказательств лучшая модель достигает сбалансированной F1-меры всего 65,1, а модели в целом демонстрируют низкий уровень истинно отрицательных результатов, что позволяет предположить, что обнаружение критических ошибок остаётся основным узким местом.
Метакогниция является фундаментальным компонентом интеллекта, критически важным для эффективного обучения, решения проблем, принятия решений, коммуникации и многого другого. В последние годы она всё чаще признается краеугольным камнем способных и прозрачных систем искусственного интеллекта. Однако, несмотря на значительный прогресс больших языковых моделей (LLM) в разнообразных реальных задачах, до сих пор неясно, когда, как и в какой степени они могут проявлять или быть наделены эффективными метакогнитивными способностями, а также как такие способности могут быть адаптированы для улучшения фундаментальных возможностей, надежности и интеллекта систем ИИ. Данная статья восполняет этот пробел, представляя первый всесторонний обзор текущего состояния знаний о метакогниции для LLM. Мы анализируем и таксономически классифицируем ландшафт этой emerging области, а также обобщаем недавние технические достижения, включая методы и бенчмарки для измерения и оценки метакогнитивных способностей LLM, техники для выявления, улучшения и применения метакогниции в LLM, а также результаты и последствия текущих исследований. Мы также обсуждаем прикладные аспекты, открытые вопросы и проблемы, а также перспективные направления будущих работ. Наша цель — предоставить подробный и актуальный обзор данной темы и стимулировать содержательные исследования и дискуссии. Упорядоченный список статей доступен по адресу: https://github.com/yale-nlp/LLM-Metacognition.
Управляемость является определяющей способностью роботов-политик общего назначения, однако в системах манипуляторов с ловкими захватами она в значительной степени отсутствует из-за нехватки масштабных, согласованных с языком и точных по действиям демонстрационных данных. Для преодоления этого узкого места мы представляем полнофункциональную систему, которая масштабирует предварительное обучение ловких VLA (Vision-Language-Action) на основе эгоцентрических видеозаписей человека и обеспечивает эффективное последующее обучение на реальном роботе с минимальным объемом данных. Система объединяет EgoSmith — конвейер данных, формирующий из «диких» эгоцентрических видео 9,6 тыс. часов высококачественных предобучающих данных с 9-кратным увеличением пропускной способности и более высокой точностью по сравнению с предыдущими SOTA; унифицированный стек робота для телеоперации и коррекции с участием человека; а также EgoSteer — VLA с улучшенной мировой моделью, обученную на оптимизированной инфраструктуре. Предварительное обучение на человеческих данных снабжает EgoSteer управляемыми языком приоритетами манипуляций, которые закрепляются в ходе последующего обучения на роботе и улучшаются с помощью уточнения DAgger. Эмпирически EgoSteer надежно выполняет инструкции произвольной формы в более чем 40 разнообразных задачах, демонстрируя восстановление после сбоев, ловкость и обобщение. Предобученная модель также адаптируется по нескольким примерам к сложным долгосрочным задачам, включая складывание коробок, на двух вариантах воплощения с вероятностью успеха более 75%. Мы публикуем систему, данные и модель с открытым исходным кодом по адресу https://egosteer.github.io/.
Пост-обучение является важным этапом для уточнения доменно-специфичных способностей больших языковых моделей (БЯМ), однако существующие методы оптимизации вознаграждения и согласования распределений тесно связывают исследование политики с выравниванием распределений. Такая связь вынуждает проводить дорогостоящее исследование непосредственно на модели политики и серьезно затрудняет асинхронную генерацию, повторное использование и межмодельный перенос сигналов оптимизации. В данной работе мы предлагаем перенос сигналов обновления с помощью прокси-модели (Proxy-guided Update Signal Transfer, PUST) — новую структуру пост-обучения, которая принципиально разделяет исследование сигналов обновления и выравнивание распределений. Вместо использования основной модели для дорогостоящего исследования, PUST применяет легковесную прокси-модель в качестве эффективного испытательного стенда для обнаружения поведений с высоким вознаграждением. Мы извлекаем сигнал относительного улучшения между начальным и оптимизированным состояниями прокси-модели и переносим это направленное обновление на основную модель для направления ее политики. Этот разделенный конвейер, состоящий из исследования прокси-модели, извлечения сигнала обновления и переноса сигнала, значительно снижает вычислительные затраты и позволяет асинхронно генерировать, кэшировать и повторно использовать сигналы оптимизации. Важно, что за счет переноса относительных улучшений, а не абсолютных распределений политики, PUST естественным образом поддерживает улучшение от слабой к сильной модели и бесшовный межмодельный перенос. Систематические оценки на моделях семейства Qwen3 в областях математики и кода демонстрируют, что сигналы обновления, извлеченные из значительно более слабых прокси-моделей, могут надежно и регулируемо улучшать более сильные основные модели. В конечном счете, PUST превращает пост-обучение из монолитного процесса онлайн-оптимизации в высокомодульную, многократно используемую и экономически эффективную парадигму.
Исследование является важным для надежной автономии в многоагентных системах, однако остается неясным, способны ли агенты на основе больших языковых моделей (LLM) эффективно исследовать при взаимодействии друг с другом. Мы показываем, что современные LLM-агенты не справляются с этим, часто демонстрируя близорукие и поляризованные шаблоны взаимодействия, которые приводят к неоптимальной координации и увеличению сожаления. Мы формализуем эту проблему как задачу многоагентного исследования, моделируя ее как задачу частично наблюдаемой стохастической игры (POSG), в которой агенты должны зондировать своих партнеров, чтобы выявить их возможности и определить эффективные стратегии взаимодействия. Для решения этой проблемы мы предлагаем Multi-Agent Contextual Exploration (MACE) — легковесную структуру, которая явно способствует исследованию путем структурированного выбора партнеров. Как в условиях контекстуального, так и параметрического разнообразия, MACE существенно улучшает исследовательское поведение и производительность последующих задач. Мы также теоретически показываем, что ценность исследования возрастает с увеличением разнообразия агентов. В целом, наши результаты подчеркивают фундаментальное ограничение современных LLM-агентов и подчеркивают важность явно направляемого исследования для надежной многоагентной автономии. Код будет опубликован по адресу https://github.com/deeplearning-wisc/mace.
Понимание того, как сложные когнитивные функции организованы в искусственных системах, является ключевым для интерпретации больших языковых моделей (LLM) и их соотнесения с биологическим познанием. Однако, несмотря на то что LLM демонстрируют широкий спектр когнитивноподобного поведения, остается неясным, образуют ли их внутренние представления воспроизводимые функциональные системы, которые объясняют поведение, сбои и связи с человеческим познанием. Здесь мы представляем NeuroCogMap — основанную на когнитивной нейронауке методологию, которая организует внутренние характеристики LLM в функциональные участки и связывает их с интерпретируемыми функциями, когнитивными способностями и когнитивной иерархией. Эти участки образуют стабильную и семантически согласованную организацию, которая частично сохраняется между моделями и функционально связана с выходами моделей. В рамках этой организации основные сбои LLM, включая галлюцинации, предвзятость, отказ от ответа и подхалимство, соответствуют различным нарушениям в системах репрезентации и поведенческого контроля, что дает внутренние сигнатуры для детекции, основанной на механизмах, и целенаправленного вмешательства. Помимо поведения модели, NeuroCogMap улучшает предсказание корковых реакций человека при естественном понимании языка, причем наиболее сильное соответствие наблюдается в ассоциативной коре высшего порядка. На когнитивном уровне его внутренние сигнатуры раскрывают скрытые стратегии, которые направляют усовершенствования классических моделей принятия решений человеком. В совокупности эти результаты утверждают NeuroCogMap как системный подход для картирования функциональной организации в искусственных системах и для соотнесения этой организации с корковой функцией человека и когнитивным поведением.
Языковые модели все чаще используются для принятия моральных решений в различных языковых и культурных контекстах, однако существующие работы не учитывают многоязычность в трех аспектах: 1) многоязычные оценочные эталоны используют прямой перевод, не адаптируя культурно-специфичные элементы; 2) методы инференса для моральных рассуждений опираются на статичные, англоцентричные шаблоны и лишены обоснования в моральной теории; 3) методы обучения для принятия моральных решений обычно требуют дорогостоящего контроля со стороны более мощных моделей или аннотаторов-людей. Мы восполняем эти пробелы тремя вкладами. Во-первых, мы представляем MCLASH — многоязычный эталон для принятия моральных решений, призванный отражать культурно обусловленные моральные интуиции и социальные нормы на разных языках. Во-вторых, мы предлагаем MET (Multilingual Ethics with Theory-grounded reasoning — многоязычная этика с теоретически обоснованными рассуждениями) — двухшаговый метод промптинга, построенный на составленных экспертами теоретических основаниях из психологии и философии: модель сначала выбирает ситуационно и культурно специфичные основания, а затем рассуждает над ними на родном языке пользователя. В-третьих, мы представляем MET-D (MET-Distillation), который улучшает второй шаг за счет этапа обучения с самодистилляцией, не требующего внешнего контроля. MET-D повышает макро-F1 относительно базовой модели на всех трех моделях разных размеров и семейств (Qwen3-4B, Qwen3-8B, Gemma3-4B) в среднем на 3,71 балла на MCLASH и на 4,23 балла на MMoralExceptQA, с пиковым приростом на MCLASH в 12,94 балла для малайского языка на Qwen3-8B. Мы также показываем, что MET-D увеличивает рассуждение на родном языке в среднем на 62,13 балла, а полезные основания систематически различаются в зависимости от культуры. В совокупности эти вклады открывают путь к культурно-согласованным, теоретически обоснованным многоязычным моральным рассуждениям.
Виртуальная примерка (VTO) достигла значительных успехов в реалистичном переносе одежды на целевого человека. Однако большинство систем предоставляют пользователю мало контроля над тем, как должна носиться одежда — её размер (свободный или облегающий), фасон (например, заправленная или незаправленная, открытая или закрытая) и пространственное расположение на теле. Мы устраняем этот пробел с помощью двух взаимодополняющих вкладов. Во-первых, мы определяем и решаем задачу сегментации по визуальному примеру экземпляра (Visual-Instance-Prompt Segmentation) с помощью VIP-SAM: по изображению одежды в разложенном виде сегментировать конкретный экземпляр на фотографии человека, который её носит. Это задача на уровне экземпляра, отличная от типично изучаемой сегментации на уровне категорий. Во-вторых, мы представляем CtrlVTON — управляемую структуру VTO, которая переосмысливает примерку как задачу редактирования изображения и добавляет маски сегментации в качестве контроля на уровне пикселей над расположением одежды, включая фасон, размер и пространственное размещение на теле. VIP-SAM и CtrlVTON достигают передовых результатов в своих задачах. В частности, CtrlVTON генерирует изображения, которые следуют предоставленным пользователем макетам гораздо точнее, чем самые мощные проприетарные системы редактирования, при этом не уступая им в соответствии одежды.
Недавние фундаментальные модели генерации изображений и видео обеспечивают сильную обобщаемость и управляемость, но их прямое применение в воплощенных сценариях ограничено требованиями к согласованности множества видов, геометрической связности и ограничениям, связанным с воплощением робота. Существующие методы обычно адаптируют фундаментальные модели с использованием ограниченных данных о роботах, часто жертвуя визуальными знаниями, полученными в ходе крупномасштабного предварительного обучения. Мы представляем Xiaomi-Robotics-U0 — мультимодальную авторегрессионную модель с 38 миллиардами параметров для унифицированного воплощенного синтеза. Она рассматривает воплощенную генерацию как расширение фундаментальной генерации изображений и видео и совместно оптимизирует генерацию текста в изображение, редактирование изображений, генерацию воплощенных сцен, воплощенный перенос и генерацию воплощенного видео. Эта унифицированная структура сохраняет обобщаемость предварительно обученной фундаментальной модели мира, адаптируя ее к воплощенным условиям. Xiaomi-Robotics-U0 — первая модель, которая поддерживает высококачественную генерацию сцен с множества видов для различных воплощений роботов и вводит структурированный управляемый воплощенный перенос для тонкодетализированного редактирования с сохранением согласованности множества видов и динамики взаимодействия. Она достигает современных результатов на задачах одношаговой и последовательной генерации, превосходя GPT-Image-2.0 в человеческих оценках воплощенной генерации сцен и переноса, занимая первое место в World Arena по воплощенной генерации видео и повышая показатель успешности вне распределения для pi_0.5 с 36,9% до 63,2% в сложных задачах манипуляции в реальном мире. Эти результаты показывают, что фундаментальные модели мира могут служить как воплощенными моделями мира, так и масштабируемыми движками данных для воплощенного интеллекта. Код и контрольные точки доступны по адресу https://robotics.xiaomi.com/xiaomi-robotics-u0.html.
Генерация и редактирование лица человека требуют высокой точности, поскольку даже незначительные изменения могут существенно повлиять на воспринимаемую идентичность субъекта. Современные методы персонализации и редактирования, основанные на универсальных моделях «текст-в-изображение», зачастую не обладают необходимой точностью для тонкой правки черт лица. Мы представляем метод точной настройки идентичности в моделях персонализации «текст-в-изображение». В отличие от стандартного редактирования изображений, которое работает с заданным снимком, настройка идентичности изменяет латентное представление конкретной идентичности, позволяя генерировать разнообразные изображения, последовательно изображающие одну и ту же отредактированную личность. Для обеспечения тонкой латентной настройки идентичности мы исследуем латентное пространство предварительно обученного замороженного кодировщика для персонализации «текст-в-изображение». Наш подход не требует дополнительного обучения. Вместо этого он использует существующую архитектуру замороженного кодировщика для выявления латентных семантических направлений. Это пространство состоит из набора латентных токенов, которые играют различные роли в захвате разных аспектов идентичности и часто соответствуют конкретным пространственным или семантическим областям лица. Мы показываем, что в этом пространстве и в подпространствах, определяемых выбранными токенами, можно идентифицировать значимые направления, что позволяет выполнять локализованные, тонкие и семантически согласованные правки. Мы подтверждаем наш подход качественными и количественными экспериментами, демонстрирующими разнообразные локализованные правки лица с сохранением согласованности идентичности между разными изображениями. Страница проекта: https://garibida.github.io/IdentityTuning/
В данной работе исследуется перенос движений из одного видео в другое, что имеет решающее значение в анимации для разнообразных персонажей. Ранее перенос движений в видео в основном изучался между людьми и человекоподобными персонажами, что открывало множество возможностей для цифрового творчества. Однако эти подходы сталкиваются с основным ограничением. В частности, соответствующие технические pipelines сильно зависят от заранее заданной скелетной структуры человека и, соответственно, требуют обучения модели с учетом скелета. С одной стороны, эти методы трудно обобщить на разнообразных персонажей, например, животных разных видов, сохраняя при этом их уникальные стили движений. С другой стороны, размеченные данные для различных скелетов ограничены, что дополнительно сужает возможности масштабного обучения для данной задачи. В этой статье мы выходим за рамки скелетно-ориентированного подхода к переносу движений и предлагаем framework для переноса движений без обучения, названный Motion4Motion. Motion4Motion моделирует поток движений персонажа в видео вместо скелетов, что упрощает перенос движений между разными видами. Многочисленные экспериментальные результаты и новые приложения показывают, что наши методы значительно превосходят базовые подходы. Страница проекта доступна по адресу https://lhchen.top/Motion4Motion.
Потоковое согласование над тщательно сконструированными латентными представлениями недавно стало мощной парадигмой для генерации сеток с учетом топологии. Однако существующие подходы моделируют вершины и связность совместно в едином латентном пространстве, запутывая непрерывную геометрию вершин с дискретной комбинаторной структурой; это усложняет обучение потокам и проявляется в виде дрейфующих вершин и разрушенных поверхностей. Мы представляем LATO.2 — факторизованный фреймворк согласования потоков, который разбивает генерацию сетки на поток вершин, за которым следует поток связности, обусловленный реализованными вершинами, при этом оба этапа привязаны к общему грубому воксельному каркасу. Выделенные VAE лежат в основе обоих этапов, восстанавливая вершины с субвоксельной точностью и встраивая дискретную связность в непрерывное латентное пространство. Мы демонстрируем два преимущества, уникальных для этой факторизации: (i) генерация по частям, при которой каркас разбивается, и каждая часть синтезируется с полной латентной емкостью, что приводит к значительно более высокому разрешению сеток, чем при монолитном латентном представлении; и (ii) топологически-адаптивное редактирование, при котором манипулирование вершинами первого этапа индуцирует соответствующую связность без повторной оптимизации. Эксперименты показывают, что LATO.2 превосходит современные генераторы сеток с учетом топологии по геометрической точности и качеству связности.
Почему контрастивное обучение с использованием простых изображений и аугментаций дает полезные представления для последующих задач? Мы рассматриваем этот вопрос, аналитически вычисляя оптимальное представление в терминах контрастивной функции потерь для ряда базовых аугментаций и любого набора изображений со стационарной статистикой. Мы показываем, что для определенных аугментаций оптимум может быть достигнут с помощью сверточной нейронной сети (CNN), первый слой которой состоит из фильтров-синусоид, за которыми следуют поточечная нелинейность, глобальное усреднение пула и финальный линейный слой, выполняющий частичное отбеливание. Мы также показываем, что оптимальные веса в таких CNN для более сложных аугментаций по-прежнему являются синусоидами. Частоты синусоид и их веса могут быть вычислены с помощью простого алгоритма «водозаполнения» на основе ожидаемого спектра мощности набора данных. Эксперименты с различными наборами изображений и аугментациями показывают, что такие CNN, обученные с помощью стохастического градиентного спуска (SGD), эмпирически обучаются синусоидам в своем первом слое и выполняют частичное отбеливание.
Современные большие видеомодели (Video LLM) демонстрируют высокую точность в задачах вопросно-ответного взаимодействия (QA), однако в значительной степени остаются «чёрными ящиками», выдавая текстовые ответы без проверяемой визуальной привязки. Существующие подходы к объяснимости опираются на текстовые обоснования или редкие ограничивающие рамки, которые плохо справляются с захватом сложной динамики видео, такой как затенения и нежёсткие деформации. Мы предлагаем задачу Evidence-Backed Video Question Answering (E-VQA) — новый формат, требующий от моделей совместного вывода семантического ответа и точных пространственно-временных свидетельств: временных сегментов и плотных, отслеживаемых масклетов сегментации объектов. Для поддержки этой задачи мы представляем ST-Evidence — первый верифицированный человеком бенчмарк для дискриминантной и генеративной привязки на уровне пикселей. Оценка современных моделей выявляет критическое рассогласование между точностью QA и истинным визуальным восприятием, которое одно лишь масштабирование не в состоянии устранить. Для решения этой проблемы мы разрабатываем масштабируемые автоматизированные конвейеры генерации, создающие ST-Evidence-Instruct — набор данных объёмом 160 тыс. примеров, соединяющий высокоуровневое рассуждение с мелкозернистой привязкой. Тонкая настройка grounded-видеомоделей на этих данных приводит к значительному улучшению по сравнению с соответствующими базовыми моделями UnPixel (например, +27,2 t-mean и +13,8 J&F для модели 7B), устанавливая надёжный базовый уровень для объяснимого, подтверждённого свидетельствами понимания видео. Код и данные доступны по адресу https://github.com/SalesforceAIResearch/EVQA.