InternVLA-A1.5: Het verenigen van begrip, latente vooruitziendheid en actie voor compositionele generalisatie
InternVLA-A1.5: Unifying Understanding, Latent Foresight, and Action for Compositional Generalization
July 6, 2026
Auteurs: Haoxiang Ma, Junhao Cai, Xiaoxu Xu, Hao Li, Yuyin Yang, Yang Tian, Jiafei Cao, Hongrui Zhu, Zherui Qiu, Zhaxizhuoma, Yuqiang Yang, Jiaqi Peng, Xueyuan Wei, Yangkun Zhu, Jiahao Jiang, Xing Gao, Hanqing Wang, Feng Yuan, Kailin Li, Xueyue Zhu, Tai Wang, Yan Ding, Jiangmiao Pang, Jia Zeng, Jingjing Zhang, Bowen Zhou, Yao Mu, Chunhua Shen, Weinan Zhang
cs.AI
Samenvatting
Uniforme modellen voor robotmanipulatie streven ernaar één beleid uit te rusten met zowel de semantische voorkennis van voorgetrainde VLM's als de fysieke dynamica die door middel van toekomstvoorspelling wordt geleerd. In de praktijk tasten bestaande ontwerpen vaak de semantiek van de voorgetrainde backbone aan, ondervinden ze interferentie tussen heterogene doelstellingen en leren ze toekomstvoorspelling vanaf nul in de pixelruimte, waardoor de dynamica-voorkennis van voorgetrainde videogeneratoren onbenut blijft. Wij presenteren InternVLA-A1.5, dat het beleid bouwt op een native VLM-backbone die blijft trainen op VQA en deeltaakvoorspelling, en een lichte, uniforme expert toevoegt voor continue actiegeneratie. Toekomstvoorspelling wordt geherformuleerd als een latent query-probleem, waarbij een kleine set leerbare vooruitzicht-tokens de taakrelevante toekomst condenseert tot een compacte latente code onder toezicht van een bevroren voorgetraind videogeneratiemodel, zodat het beleid wereldmodel-dynamica-voorkennis erft zonder ooit pixelniveau-generatie te leren. De videotak wordt bij inferentie verwijderd, waardoor real-time besturing behouden blijft. Voorgetraind op 1,2M robotepisodes en 3M multimodale voorbeelden, behaalt InternVLA-A1.5 de beste algemene resultaten op alle zes simulatiebenchmarks. In de echte wereld levert de behouden semantiek de sterkste compositionele generalisatie op buiten beschouwing gelaten instructiekoppelingen, en de twee ontwerpen samen ondersteunen langetermijnuitvoering.
English
Unified models for robot manipulation aim to equip one policy with both the semantic priors of pretrained VLMs and the physical dynamics learned through future prediction. In practice, existing designs tend to erode the semantics of the pretrained backbone, suffer interference among heterogeneous objectives, and learn future prediction from scratch in pixel space, leaving the dynamics priors of pretrained video generators unexploited. We present InternVLA-A1.5, which builds the policy on a native VLM backbone that keeps training on VQA and subtask prediction, and attaches a lightweight unified expert for continuous action generation. Future prediction is recast as a latent-querying problem, where a small set of learnable foresight tokens condenses the task-relevant future into a compact latent code under the supervision of a frozen pretrained video generation model, so the policy inherits world-model dynamics priors without ever learning pixel-level generation. The video branch is discarded at inference, keeping real-time control. Pretrained on 1.2M robot episodes and 3M multimodal samples, InternVLA-A1.5 achieves the best overall results on all six simulation benchmarks. In the real world, the preserved semantics deliver the strongest compositional generalization on held-out instruction bindings, and the two designs together sustain long-horizon execution.