ChatPaper.aiChatPaper

Da Fundação à Aplicação: Aprimorando Modelos VLA na Prática

From Foundation to Application: Improving VLA Models in Practice

July 7, 2026
Autores: Wei Wu, Fangjing Wang, Fan Lu, He Sun, Shi Liu, Yunnan Wang, Yibin Yan, Yong Wang, Shuailei Ma, Xinyang Wang, Yibin Liu, Shuai Yang, Tianxiang Zhou, Kejia Zhang, Lei Zhou, Cheng Su, Nan Xue, Bin Tan, Han Zhang, Youchao Zhang, Fei Liao, Xing Zhu, Yujun Shen, Kecheng Zheng
cs.AI

Resumo

Apesar do progresso recente dos modelos fundamentais VLA, a disparidade entre as condições laboratoriais e as aplicações do mundo real continua a impedir sua implementação prática. Para superar essa lacuna, apresentamos o LingBot-VLA 2.0, que aprimora o LingBot-VLA por meio de melhorias em três domínios funcionais. (1) Generalização entre tarefas e corporificações. Em comparação com a versão anterior, reformulamos o pipeline de processamento de dados e curamos cerca de 60.000 horas de dados para pré-treinamento, incluindo 50.000 horas de trajetórias robóticas abrangendo 20 configurações de robôs e 10.000 horas de vídeos humanos egocêntricos. (2) Espaço de ação expandido, além das plataformas de hardware de braço duplo. Em particular, nosso sistema acomoda graus de liberdade para cabeças, troncos, bases móveis e mãos hábeis, capacitando assim os robôs a lidar com tarefas mais complexas em cenários práticos. (3) Modelagem preditiva de dinâmica para melhor raciocínio temporal. Especificamente, formulamos a previsão futura como uma tarefa proxy, facilitada por um modelo de representação de vídeo para priores semânticos e um modelo de estimativa de profundidade para pistas geométricas. Avaliações no benchmark GM-100, conduzidas em uma configuração generalista, validam o impacto benéfico dessas modificações propostas. Além disso, beneficiando-se dos dados expandidos de pré-treinamento que abrangem graus de liberdade do corpo inteiro, o LingBot-VLA-2.0 demonstra forte capacidade de manipulação móvel de longo horizonte e transversal a corporificações em ambas as plataformas robóticas.
English
Despite recent progress of VLA foundation models, the disparity between laboratory conditions and real-world applications continues to impede their practical implementation. To bridge this gap, we present LingBot-VLA 2.0, which advances LingBot-VLA through improvements in three functional domains. (1) Generalization across tasks and embodiments. Compared to the previous version, we revamp the data processing pipeline and curate around 60,000 hours of data for pretraining, including 50,000 hours of robot trajectories spanning 20 robot configurations and 10,000 hours of egocentric human videos. (2) Expanded action space in addition to dual-arm hardware platforms. In particular, our system accommodates degrees of freedom for the heads, waists, mobile bases, and dexterous hands, thereby empowering the robots to tackle more complex tasks in practical scenarios. (3) Predictive dynamics modeling for improved temporal reasoning. Specifically, we formulate future prediction as a proxy task, facilitated by a video representation model for semantic priors and a depth estimation model for geometric cues. Evaluations on the GM-100 benchmark, conducted in a generalist setting, validate the beneficial impact of these proposed modifications. Furthermore, benefiting from the expanded pretraining data that covers whole-body degrees of freedom, LingBot-VLA-2.0 demonstrates strong cross-embodiment long-horizon mobile manipulation capability across the two robotic platforms.