InternVLA-A1.5 : Unification de la compréhension, de l'anticipation latente et de l'action pour la généralisation compositionnelle
InternVLA-A1.5: Unifying Understanding, Latent Foresight, and Action for Compositional Generalization
July 6, 2026
Auteurs: Haoxiang Ma, Junhao Cai, Xiaoxu Xu, Hao Li, Yuyin Yang, Yang Tian, Jiafei Cao, Hongrui Zhu, Zherui Qiu, Zhaxizhuoma, Yuqiang Yang, Jiaqi Peng, Xueyuan Wei, Yangkun Zhu, Jiahao Jiang, Xing Gao, Hanqing Wang, Feng Yuan, Kailin Li, Xueyue Zhu, Tai Wang, Yan Ding, Jiangmiao Pang, Jia Zeng, Jingjing Zhang, Bowen Zhou, Yao Mu, Chunhua Shen, Weinan Zhang
cs.AI
Résumé
Les modèles unifiés pour la manipulation robotique visent à doter une politique à la fois des a priori sémantiques des VLM pré-entraînés et de la dynamique physique apprise par prédiction du futur. En pratique, les conceptions existantes tendent à éroder la sémantique du backbone pré-entraîné, à subir des interférences entre des objectifs hétérogènes et à apprendre la prédiction du futur à partir de zéro dans l'espace pixel, laissant inexploités les a priori de dynamique des générateurs vidéo pré-entraînés. Nous présentons InternVLA-A1.5, qui construit la politique sur un backbone VLM natif qui continue à s'entraîner sur la VQA et la prédiction de sous-tâches, et y attache un expert unifié léger pour la génération d'actions continues. La prédiction du futur est reformulée comme un problème d'interrogation latente, où un petit ensemble de jetons de prévoyance apprenables condense le futur pertinent pour la tâche en un code latent compact sous la supervision d'un modèle de génération vidéo pré-entraîné figé, de sorte que la politique hérite des a priori de dynamique du modèle du monde sans jamais apprendre la génération au niveau pixel. La branche vidéo est abandonnée lors de l'inférence, garantissant un contrôle en temps réel. Pré-entraîné sur 1,2 million d'épisodes robotiques et 3 millions d'échantillons multimodaux, InternVLA-A1.5 obtient les meilleurs résultats globaux sur l'ensemble des six benchmarks de simulation. Dans le monde réel, la sémantique préservée offre la meilleure généralisation compositionnelle sur des associations d'instructions exclues, et les deux conceptions ensemble soutiennent une exécution à long horizon.
English
Unified models for robot manipulation aim to equip one policy with both the semantic priors of pretrained VLMs and the physical dynamics learned through future prediction. In practice, existing designs tend to erode the semantics of the pretrained backbone, suffer interference among heterogeneous objectives, and learn future prediction from scratch in pixel space, leaving the dynamics priors of pretrained video generators unexploited. We present InternVLA-A1.5, which builds the policy on a native VLM backbone that keeps training on VQA and subtask prediction, and attaches a lightweight unified expert for continuous action generation. Future prediction is recast as a latent-querying problem, where a small set of learnable foresight tokens condenses the task-relevant future into a compact latent code under the supervision of a frozen pretrained video generation model, so the policy inherits world-model dynamics priors without ever learning pixel-level generation. The video branch is discarded at inference, keeping real-time control. Pretrained on 1.2M robot episodes and 3M multimodal samples, InternVLA-A1.5 achieves the best overall results on all six simulation benchmarks. In the real world, the preserved semantics deliver the strongest compositional generalization on held-out instruction bindings, and the two designs together sustain long-horizon execution.