ChatPaper.aiChatPaper

От основ к применению: совершенствование моделей VLA на практике

From Foundation to Application: Improving VLA Models in Practice

July 7, 2026
Авторы: Wei Wu, Fangjing Wang, Fan Lu, He Sun, Shi Liu, Yunnan Wang, Yibin Yan, Yong Wang, Shuailei Ma, Xinyang Wang, Yibin Liu, Shuai Yang, Tianxiang Zhou, Kejia Zhang, Lei Zhou, Cheng Su, Nan Xue, Bin Tan, Han Zhang, Youchao Zhang, Fei Liao, Xing Zhu, Yujun Shen, Kecheng Zheng
cs.AI

Аннотация

Несмотря на недавние успехи в создании фундаментальных моделей VLA, разрыв между лабораторными условиями и реальными приложениями продолжает препятствовать их практическому внедрению. Для преодоления этого разрыва мы представляем LingBot-VLA 2.0, который развивает LingBot-VLA за счет улучшений в трех функциональных областях. (1) Обобщение на различные задачи и воплощения. По сравнению с предыдущей версией, мы переработали конвейер обработки данных и собрали около 60 000 часов данных для предварительного обучения, включая 50 000 часов траекторий роботов, охватывающих 20 конфигураций роботов, и 10 000 часов эгоцентричных видеозаписей человека. (2) Расширенное пространство действий в дополнение к аппаратным платформам с двумя манипуляторами. В частности, наша система учитывает степени свободы голов, корпусов, мобильных баз и ловких рук, что позволяет роботам решать более сложные задачи в практических сценариях. (3) Прогностическое моделирование динамики для улучшения временного рассуждения. В частности, мы формулируем предсказание будущего как прокси-задачу, облегчаемую моделью представления видео для семантических априорных знаний и моделью оценки глубины для геометрических подсказок. Оценки на тестовом наборе GM-100, проведенные в условиях общего назначения, подтверждают положительное влияние этих предложенных модификаций. Кроме того, благодаря расширенным данным предварительного обучения, охватывающим степени свободы всего тела, LingBot-VLA-2.0 демонстрирует высокую способность к кросс-воплощенной долгосрочной мобильной манипуляции на двух роботизированных платформах.
English
Despite recent progress of VLA foundation models, the disparity between laboratory conditions and real-world applications continues to impede their practical implementation. To bridge this gap, we present LingBot-VLA 2.0, which advances LingBot-VLA through improvements in three functional domains. (1) Generalization across tasks and embodiments. Compared to the previous version, we revamp the data processing pipeline and curate around 60,000 hours of data for pretraining, including 50,000 hours of robot trajectories spanning 20 robot configurations and 10,000 hours of egocentric human videos. (2) Expanded action space in addition to dual-arm hardware platforms. In particular, our system accommodates degrees of freedom for the heads, waists, mobile bases, and dexterous hands, thereby empowering the robots to tackle more complex tasks in practical scenarios. (3) Predictive dynamics modeling for improved temporal reasoning. Specifically, we formulate future prediction as a proxy task, facilitated by a video representation model for semantic priors and a depth estimation model for geometric cues. Evaluations on the GM-100 benchmark, conducted in a generalist setting, validate the beneficial impact of these proposed modifications. Furthermore, benefiting from the expanded pretraining data that covers whole-body degrees of freedom, LingBot-VLA-2.0 demonstrates strong cross-embodiment long-horizon mobile manipulation capability across the two robotic platforms.