Vesta: Een generalistisch embodied reasoning model
Vesta: A Generalist Embodied Reasoning Model
June 18, 2026
Auteurs: Johan Bjorck, Zhiqi Li, Yunze Man, Jing Wang, An-Chieh Cheng, Sifei Liu, Shihao Wang, Zhiding Yu, Abhishek Badki, Stan Birchfield, Valts Blukis, Yevgen Chebotar, Siyi Chen, Sicong Leng, Yu-Cheng Chou, Tianli Ding, Boyi Li, Zhengyi Luo, Hang Su, Jonathan Tremblay, Tingwu Wang, Bowen Wen, Jimmy Wu, Xianghui Xie, Hanrong Ye, Hongxu Yin, K. R. Zentner, Liangyan Gui, Yu-Xiong Wang, Yuke Zhu, Linxi "Jim" Fan, Jan Kautz
cs.AI
Samenvatting
Robots die opereren in open-wereldomgevingen moeten lokalisatie, ruimtelijk redeneren, navigatie en planning over lange tijdshorizonten naadloos integreren. Hoewel specialistische modellen uitblinken in individuele taken, is het inzetten van een multi-modelstack rekenintensief en vatbaar voor cascadefouten. Wij presenteren Vesta, een verenigde belichaamde generalist die deze capaciteiten consolideert in één enkel fundatiemodel. Onze aanpak combineert een divers en omvangrijk samengesteld corpus dat is ontworpen om ruimtelijke verankering te induceren, met een eenvoudig multimodaal geheugenmechanisme dat redeneren over uitgebreide tijdshorizonten mogelijk maakt. Over diverse benchmarks heen presteert Vesta gemiddeld >20% beter dan individuele SOTA-baselines en >10% beter dan een ensemble van per-categorie beste baselines – waarmee wordt aangetoond dat een generalistisch model specialisten kan evenaren of overtreffen. Bij robotica taken in de echte wereld die geheugen en redeneren vereisen, verbetert Vesta het taaksucces met >35%. Ons werk toont daarmee aan dat een enkele generalist een haalbaar, schaalbaar en bij voorkeur te verkiezen alternatief is voor het combineren van specialisten.
English
Robots operating in open-world environments must seamlessly integrate localization, spatial reasoning, navigation, and long-horizon planning. While specialist models excel at individual tasks, deploying a multi-model stack is computationally expensive and prone to cascading errors. We present Vesta, a unified embodied generalist that consolidates these capabilities into a single foundation model. Our approach combines a diverse and massive curated corpus designed to induce spatial grounding and a simple multimodal memory harness that enables reasoning over extended time horizons. Across diverse benchmarks, Vesta on average beats individual SOTA baselines by >20% and beats an ensemble of per-category-best baselines by >10% -- thus demonstrating that a generalist model can match or exceed specialists. On real-world robotic tasks requiring memory and reasoning, Vesta improves task success by >35\%. Our work thus demonstrates that a single generalist is a feasible, scalable, and arguably preferable alternative to combining specialists.