ChatPaper.aiChatPaper

InternVLA-A1.5: Unificación de Comprensión, Previsión Latente y Acción para la Generalización Compositiva

InternVLA-A1.5: Unifying Understanding, Latent Foresight, and Action for Compositional Generalization

July 6, 2026
Autores: Haoxiang Ma, Junhao Cai, Xiaoxu Xu, Hao Li, Yuyin Yang, Yang Tian, Jiafei Cao, Hongrui Zhu, Zherui Qiu, Zhaxizhuoma, Yuqiang Yang, Jiaqi Peng, Xueyuan Wei, Yangkun Zhu, Jiahao Jiang, Xing Gao, Hanqing Wang, Feng Yuan, Kailin Li, Xueyue Zhu, Tai Wang, Yan Ding, Jiangmiao Pang, Jia Zeng, Jingjing Zhang, Bowen Zhou, Yao Mu, Chunhua Shen, Weinan Zhang
cs.AI

Resumen

Los modelos unificados para la manipulación robótica buscan equipar una política tanto con los priors semánticos de los VLM preentrenados como con la dinámica física aprendida mediante la predicción del futuro. En la práctica, los diseños existentes tienden a erosionar la semántica del backbone preentrenado, sufrir interferencias entre objetivos heterogéneos y aprender la predicción del futuro desde cero en el espacio de píxeles, dejando sin explotar los priors dinámicos de los generadores de video preentrenados. Presentamos InternVLA-A1.5, que construye la política sobre un backbone VLM nativo que continúa entrenándose en VQA y predicción de subtareas, y adjunta un experto unificado ligero para la generación de acciones continuas. La predicción del futuro se reformula como un problema de consulta en espacio latente, donde un pequeño conjunto de tokens de previsión aprendibles condensa el futuro relevante para la tarea en un código latente compacto bajo la supervisión de un modelo de generación de video preentrenado congelado, de modo que la política hereda priors dinámicos de modelo del mundo sin aprender nunca la generación a nivel de píxeles. La rama de video se descarta en la inferencia, manteniendo el control en tiempo real. Pretreinado con 1,2 millones de episodios robóticos y 3 millones de muestras multimodales, InternVLA-A1.5 logra los mejores resultados globales en los seis benchmarks de simulación. En el mundo real, la semántica preservada ofrece la generalización composicional más sólida en vinculaciones de instrucciones no vistas, y ambos diseños juntos sostienen la ejecución a largo plazo.
English
Unified models for robot manipulation aim to equip one policy with both the semantic priors of pretrained VLMs and the physical dynamics learned through future prediction. In practice, existing designs tend to erode the semantics of the pretrained backbone, suffer interference among heterogeneous objectives, and learn future prediction from scratch in pixel space, leaving the dynamics priors of pretrained video generators unexploited. We present InternVLA-A1.5, which builds the policy on a native VLM backbone that keeps training on VQA and subtask prediction, and attaches a lightweight unified expert for continuous action generation. Future prediction is recast as a latent-querying problem, where a small set of learnable foresight tokens condenses the task-relevant future into a compact latent code under the supervision of a frozen pretrained video generation model, so the policy inherits world-model dynamics priors without ever learning pixel-level generation. The video branch is discarded at inference, keeping real-time control. Pretrained on 1.2M robot episodes and 3M multimodal samples, InternVLA-A1.5 achieves the best overall results on all six simulation benchmarks. In the real world, the preserved semantics deliver the strongest compositional generalization on held-out instruction bindings, and the two designs together sustain long-horizon execution.