Des fondements à l'application : améliorer les modèles VLA en pratique
From Foundation to Application: Improving VLA Models in Practice
July 7, 2026
Auteurs: Wei Wu, Fangjing Wang, Fan Lu, He Sun, Shi Liu, Yunnan Wang, Yibin Yan, Yong Wang, Shuailei Ma, Xinyang Wang, Yibin Liu, Shuai Yang, Tianxiang Zhou, Kejia Zhang, Lei Zhou, Cheng Su, Nan Xue, Bin Tan, Han Zhang, Youchao Zhang, Fei Liao, Xing Zhu, Yujun Shen, Kecheng Zheng
cs.AI
Résumé
Malgré les progrès récents des modèles de fondation VLA, l'écart entre les conditions de laboratoire et les applications réelles continue d'entraver leur mise en œuvre pratique. Pour combler ce fossé, nous présentons LingBot-VLA 2.0, qui fait progresser LingBot-VLA grâce à des améliorations dans trois domaines fonctionnels. (1) Généralisation à travers les tâches et les embodiments. Par rapport à la version précédente, nous avons repensé la pipeline de traitement des données et rassemblé environ 60 000 heures de données pour le pré-entraînement, incluant 50 000 heures de trajectoires robotiques couvrant 20 configurations de robots et 10 000 heures de vidéos humaines égocentriques. (2) Espace d'action élargi en plus des plateformes matérielles à deux bras. En particulier, notre système prend en compte les degrés de liberté des têtes, des torses, des bases mobiles et des mains dextres, permettant ainsi aux robots d'aborder des tâches plus complexes dans des scénarios pratiques. (3) Modélisation dynamique prédictive pour un meilleur raisonnement temporel. Plus précisément, nous formulons la prédiction future comme une tâche proxy, facilitée par un modèle de représentation vidéo pour les a priori sémantiques et un modèle d'estimation de profondeur pour les indices géométriques. Les évaluations sur le benchmark GM-100, menées dans un cadre généraliste, valident l'impact bénéfique de ces modifications proposées. De plus, grâce aux données de pré-entraînement étendues qui couvrent les degrés de liberté du corps entier, LingBot-VLA-2.0 démontre une forte capacité de manipulation mobile à long horizon inter-embodiments sur les deux plateformes robotiques.
English
Despite recent progress of VLA foundation models, the disparity between laboratory conditions and real-world applications continues to impede their practical implementation. To bridge this gap, we present LingBot-VLA 2.0, which advances LingBot-VLA through improvements in three functional domains. (1) Generalization across tasks and embodiments. Compared to the previous version, we revamp the data processing pipeline and curate around 60,000 hours of data for pretraining, including 50,000 hours of robot trajectories spanning 20 robot configurations and 10,000 hours of egocentric human videos. (2) Expanded action space in addition to dual-arm hardware platforms. In particular, our system accommodates degrees of freedom for the heads, waists, mobile bases, and dexterous hands, thereby empowering the robots to tackle more complex tasks in practical scenarios. (3) Predictive dynamics modeling for improved temporal reasoning. Specifically, we formulate future prediction as a proxy task, facilitated by a video representation model for semantic priors and a depth estimation model for geometric cues. Evaluations on the GM-100 benchmark, conducted in a generalist setting, validate the beneficial impact of these proposed modifications. Furthermore, benefiting from the expanded pretraining data that covers whole-body degrees of freedom, LingBot-VLA-2.0 demonstrates strong cross-embodiment long-horizon mobile manipulation capability across the two robotic platforms.