ChatPaper.aiChatPaper

InternVLA-A1.5: Объединение понимания, латентного предвидения и действия для композиционального обобщения

InternVLA-A1.5: Unifying Understanding, Latent Foresight, and Action for Compositional Generalization

July 6, 2026
Авторы: Haoxiang Ma, Junhao Cai, Xiaoxu Xu, Hao Li, Yuyin Yang, Yang Tian, Jiafei Cao, Hongrui Zhu, Zherui Qiu, Zhaxizhuoma, Yuqiang Yang, Jiaqi Peng, Xueyuan Wei, Yangkun Zhu, Jiahao Jiang, Xing Gao, Hanqing Wang, Feng Yuan, Kailin Li, Xueyue Zhu, Tai Wang, Yan Ding, Jiangmiao Pang, Jia Zeng, Jingjing Zhang, Bowen Zhou, Yao Mu, Chunhua Shen, Weinan Zhang
cs.AI

Аннотация

Унифицированные модели для манипуляции роботами нацелены на то, чтобы оснастить единую политику как семантическими априорными знаниями предварительно обученных VLM, так и физической динамикой, осваиваемой через прогнозирование будущего. На практике существующие подходы, как правило, размывают семантику предварительно обученной базовой модели, страдают от интерференции между разнородными задачами и изучают прогнозирование будущего с нуля в пиксельном пространстве, оставляя неиспользованными априорные знания о динамике, заложенные в предварительно обученных генераторах видео. Мы представляем InternVLA-A1.5, которая строит политику на основе нативной базовой модели VLM, непрерывно обучающейся на задачах VQA и прогнозирования подзадач, и добавляет легковесный унифицированный эксперт для непрерывной генерации действий. Прогнозирование будущего переосмыслено как задача латентного запроса, где небольшой набор обучаемых токенов предвидения конденсирует релевантное задаче будущее в компактный латентный код под наблюдением замороженной предварительно обученной модели генерации видео, так что политика наследует априорные знания о динамике модели мира, не изучая генерации на уровне пикселей. На этапе вывода ветвь видео отбрасывается, сохраняя управление в реальном времени. Предварительно обученная на 1,2 млн роботизированных эпизодов и 3 млн мультимодальных образцов, InternVLA-A1.5 достигает наилучших совокупных результатов на всех шести симуляционных бенчмарках. В реальном мире сохраненная семантика обеспечивает наилучшее композиционное обобщение на связки команд, не встречавшиеся при обучении, а два этих решения вместе поддерживают выполнение задач на длинном горизонте.
English
Unified models for robot manipulation aim to equip one policy with both the semantic priors of pretrained VLMs and the physical dynamics learned through future prediction. In practice, existing designs tend to erode the semantics of the pretrained backbone, suffer interference among heterogeneous objectives, and learn future prediction from scratch in pixel space, leaving the dynamics priors of pretrained video generators unexploited. We present InternVLA-A1.5, which builds the policy on a native VLM backbone that keeps training on VQA and subtask prediction, and attaches a lightweight unified expert for continuous action generation. Future prediction is recast as a latent-querying problem, where a small set of learnable foresight tokens condenses the task-relevant future into a compact latent code under the supervision of a frozen pretrained video generation model, so the policy inherits world-model dynamics priors without ever learning pixel-level generation. The video branch is discarded at inference, keeping real-time control. Pretrained on 1.2M robot episodes and 3M multimodal samples, InternVLA-A1.5 achieves the best overall results on all six simulation benchmarks. In the real world, the preserved semantics deliver the strongest compositional generalization on held-out instruction bindings, and the two designs together sustain long-horizon execution.