ChatPaper.aiChatPaper

De los Fundamentos a la Aplicación: Mejorando los Modelos VLA en la Práctica

From Foundation to Application: Improving VLA Models in Practice

July 7, 2026
Autores: Wei Wu, Fangjing Wang, Fan Lu, He Sun, Shi Liu, Yunnan Wang, Yibin Yan, Yong Wang, Shuailei Ma, Xinyang Wang, Yibin Liu, Shuai Yang, Tianxiang Zhou, Kejia Zhang, Lei Zhou, Cheng Su, Nan Xue, Bin Tan, Han Zhang, Youchao Zhang, Fei Liao, Xing Zhu, Yujun Shen, Kecheng Zheng
cs.AI

Resumen

A pesar de los recientes avances en los modelos fundacionales VLA, la disparidad entre las condiciones de laboratorio y las aplicaciones del mundo real sigue dificultando su implementación práctica. Para cerrar esta brecha, presentamos LingBot-VLA 2.0, que mejora LingBot-VLA mediante avances en tres dominios funcionales. (1) Generalización entre tareas y morfologías. En comparación con la versión anterior, renovamos el pipeline de procesamiento de datos y curamos aproximadamente 60,000 horas de datos para el preentrenamiento, incluyendo 50,000 horas de trayectorias robóticas que abarcan 20 configuraciones de robots y 10,000 horas de videos humanos egocéntricos. (2) Espacio de acción ampliado, además de plataformas hardware de dos brazos. En particular, nuestro sistema contempla grados de libertad para las cabezas, cinturas, bases móviles y manos diestras, lo que permite a los robots abordar tareas más complejas en escenarios prácticos. (3) Modelado dinámico predictivo para mejorar el razonamiento temporal. Específicamente, formulamos la predicción futura como una tarea proxy, facilitada por un modelo de representación de video para prioridades semánticas y un modelo de estimación de profundidad para señales geométricas. Las evaluaciones en el benchmark GM-100, realizadas en un entorno generalista, validan el impacto beneficioso de estas modificaciones propuestas. Además, gracias a la ampliación de los datos de preentrenamiento que cubren los grados de libertad de todo el cuerpo, LingBot-VLA-2.0 demuestra una sólida capacidad de manipulación móvil de largo horizonte y con morfología cruzada en las dos plataformas robóticas.
English
Despite recent progress of VLA foundation models, the disparity between laboratory conditions and real-world applications continues to impede their practical implementation. To bridge this gap, we present LingBot-VLA 2.0, which advances LingBot-VLA through improvements in three functional domains. (1) Generalization across tasks and embodiments. Compared to the previous version, we revamp the data processing pipeline and curate around 60,000 hours of data for pretraining, including 50,000 hours of robot trajectories spanning 20 robot configurations and 10,000 hours of egocentric human videos. (2) Expanded action space in addition to dual-arm hardware platforms. In particular, our system accommodates degrees of freedom for the heads, waists, mobile bases, and dexterous hands, thereby empowering the robots to tackle more complex tasks in practical scenarios. (3) Predictive dynamics modeling for improved temporal reasoning. Specifically, we formulate future prediction as a proxy task, facilitated by a video representation model for semantic priors and a depth estimation model for geometric cues. Evaluations on the GM-100 benchmark, conducted in a generalist setting, validate the beneficial impact of these proposed modifications. Furthermore, benefiting from the expanded pretraining data that covers whole-body degrees of freedom, LingBot-VLA-2.0 demonstrates strong cross-embodiment long-horizon mobile manipulation capability across the two robotic platforms.