ChatPaper.aiChatPaper

InternVLA-A1.5: Unificando Compreensão, Previsão Latente e Ação para Generalização Composicional

InternVLA-A1.5: Unifying Understanding, Latent Foresight, and Action for Compositional Generalization

July 6, 2026
Autores: Haoxiang Ma, Junhao Cai, Xiaoxu Xu, Hao Li, Yuyin Yang, Yang Tian, Jiafei Cao, Hongrui Zhu, Zherui Qiu, Zhaxizhuoma, Yuqiang Yang, Jiaqi Peng, Xueyuan Wei, Yangkun Zhu, Jiahao Jiang, Xing Gao, Hanqing Wang, Feng Yuan, Kailin Li, Xueyue Zhu, Tai Wang, Yan Ding, Jiangmiao Pang, Jia Zeng, Jingjing Zhang, Bowen Zhou, Yao Mu, Chunhua Shen, Weinan Zhang
cs.AI

Resumo

Modelos unificados para manipulação robótica têm como objetivo equipar uma única política tanto com os priors semânticos de VLMs pré-treinados quanto com a dinâmica física aprendida por meio da predição futura. Na prática, projetos existentes tendem a erodir a semântica do backbone pré-treinado, sofrer interferência entre objetivos heterogêneos e aprender predição futura do zero no espaço de pixels, deixando inexplorados os priors de dinâmica de geradores de vídeo pré-treinados. Apresentamos o InternVLA-A1.5, que constrói a política sobre um backbone VLM nativo que continua treinando em VQA e predição de subtarefas, e anexa um especialista unificado leve para geração contínua de ações. A predição futura é reformulada como um problema de consulta latente, onde um pequeno conjunto de tokens de previsão aprendíveis condensa o futuro relevante para a tarefa em um código latente compacto sob a supervisão de um modelo de geração de vídeo pré-treinado congelado, de modo que a política herde priors de dinâmica de modelo mundial sem nunca aprender geração em nível de pixel. O ramo de vídeo é descartado na inferência, mantendo o controle em tempo real. Pré-treinado em 1,2 milhões de episódios robóticos e 3 milhões de amostras multimodais, o InternVLA-A1.5 alcança os melhores resultados gerais em todos os seis benchmarks de simulação. No mundo real, a semântica preservada proporciona a mais forte generalização composicional em vinculações de instruções não vistas, e os dois projetos juntos sustentam a execução de longo horizonte.
English
Unified models for robot manipulation aim to equip one policy with both the semantic priors of pretrained VLMs and the physical dynamics learned through future prediction. In practice, existing designs tend to erode the semantics of the pretrained backbone, suffer interference among heterogeneous objectives, and learn future prediction from scratch in pixel space, leaving the dynamics priors of pretrained video generators unexploited. We present InternVLA-A1.5, which builds the policy on a native VLM backbone that keeps training on VQA and subtask prediction, and attaches a lightweight unified expert for continuous action generation. Future prediction is recast as a latent-querying problem, where a small set of learnable foresight tokens condenses the task-relevant future into a compact latent code under the supervision of a frozen pretrained video generation model, so the policy inherits world-model dynamics priors without ever learning pixel-level generation. The video branch is discarded at inference, keeping real-time control. Pretrained on 1.2M robot episodes and 3M multimodal samples, InternVLA-A1.5 achieves the best overall results on all six simulation benchmarks. In the real world, the preserved semantics deliver the strongest compositional generalization on held-out instruction bindings, and the two designs together sustain long-horizon execution.