Vesta: Modelo Generalista de Raciocínio Corporificado
Vesta: A Generalist Embodied Reasoning Model
June 18, 2026
Autores: Johan Bjorck, Zhiqi Li, Yunze Man, Jing Wang, An-Chieh Cheng, Sifei Liu, Shihao Wang, Zhiding Yu, Abhishek Badki, Stan Birchfield, Valts Blukis, Yevgen Chebotar, Siyi Chen, Sicong Leng, Yu-Cheng Chou, Tianli Ding, Boyi Li, Zhengyi Luo, Hang Su, Jonathan Tremblay, Tingwu Wang, Bowen Wen, Jimmy Wu, Xianghui Xie, Hanrong Ye, Hongxu Yin, K. R. Zentner, Liangyan Gui, Yu-Xiong Wang, Yuke Zhu, Linxi "Jim" Fan, Jan Kautz
cs.AI
Resumo
Robôs operando em ambientes de mundo aberto devem integrar perfeitamente localização, raciocínio espacial, navegação e planejamento de longo horizonte. Embora modelos especialistas se destaquem em tarefas individuais, implantar uma pilha de múltiplos modelos é computacionalmente caro e propenso a erros em cascata. Apresentamos o Vesta, um generalista corporificado unificado que consolida essas capacidades em um único modelo de base. Nossa abordagem combina um corpus diverso e massivo, cuidadosamente curado para induzir ancoragem espacial, e um harness de memória multimodal simples que possibilita raciocínio ao longo de horizontes temporais estendidos. Em diversos benchmarks, o Vesta supera, em média, as linhas de base SOTA individuais em mais de 20% e supera um ensemble das melhores linhas de base por categoria em mais de 10% — demonstrando assim que um modelo generalista pode igualar ou exceder especialistas. Em tarefas robóticas do mundo real que exigem memória e raciocínio, o Vesta melhora o sucesso das tarefas em mais de 35%. Nosso trabalho demonstra, portanto, que um único generalista é uma alternativa viável, escalável e, argumentavelmente, preferível à combinação de especialistas.
English
Robots operating in open-world environments must seamlessly integrate localization, spatial reasoning, navigation, and long-horizon planning. While specialist models excel at individual tasks, deploying a multi-model stack is computationally expensive and prone to cascading errors. We present Vesta, a unified embodied generalist that consolidates these capabilities into a single foundation model. Our approach combines a diverse and massive curated corpus designed to induce spatial grounding and a simple multimodal memory harness that enables reasoning over extended time horizons. Across diverse benchmarks, Vesta on average beats individual SOTA baselines by >20% and beats an ensemble of per-category-best baselines by >10% -- thus demonstrating that a generalist model can match or exceed specialists. On real-world robotic tasks requiring memory and reasoning, Vesta improves task success by >35\%. Our work thus demonstrates that a single generalist is a feasible, scalable, and arguably preferable alternative to combining specialists.