MolmoAct2: Modelos de Raciocínio de Ação para Implantação no Mundo Real
MolmoAct2: Action Reasoning Models for Real-world Deployment
May 4, 2026
Autores: Haoquan Fang, Jiafei Duan, Donovan Clay, Sam Wang, Shuo Liu, Weikai Huang, Xiang Fan, Wei-Chuan Tsai, Shirui Chen, Yi Ru Wang, Shanli Xing, Jaemin Cho, Jae Sung Park, Ainaz Eftekhar, Peter Sushko, Karen Farley, Angad Wadhwa, Cole Harrison, Winson Han, Ying-Chun Lee, Eli VanderBilt, Rose Hendrix, Suveen Ellawela, Lucas Ngoo, Joyce Chai, Zhongzheng Ren, Ali Farhadi, Dieter Fox, Ranjay Krishna
cs.AI
Resumo
Os modelos Visão-Linguagem-Ação (VLA) visam fornecer um controlador generalista único para robôs, mas os sistemas atuais ficam aquém dos critérios importantes para implantação no mundo real. Os modelos de fronteira são fechados, as alternativas de pesos abertos estão vinculadas a hardware caro, políticas com aumento de raciocínio pagam uma latência proibitiva por sua fundamentação, e as taxas de sucesso ajustadas permanecem abaixo do limiar para uso confiável. Apresentamos o MolmoAct2, um modelo de raciocínio de ação totalmente aberto construído para implantação prática, avançando seu predecessor em cinco eixos. Introduzimos o MolmoER, um backbone VLM especializado para raciocínio espacial e corporificado, treinado em um corpus de 3,3 milhões de amostras com uma receita de especializar-depois-repetir. Lançamos três novos conjuntos de dados abrangendo plataformas de baixo a médio custo, incluindo o MolmoAct2-BimanualYAM, 720 horas de trajetórias bimanuais teleoperadas que constituem o maior conjunto de dados bimanual aberto até hoje, juntamente com subconjuntos filtrados por qualidade de Franka (DROID) e SO100/101. Fornecemos o OpenFAST, um tokenizador de ação de pesos abertos e dados abertos treinado em milhões de trajetórias em cinco embodimentos. Redesenhamos a arquitetura para enxertar um especialista em ação contínua por correspondência de fluxo em um VLM de token discreto via condicionamento de cache KV por camada. Finalmente, propomos o MolmoThink, uma variante de raciocínio de profundidade adaptativa que reprediz tokens de profundidade apenas para regiões da cena que mudam entre intervalos de tempo, retendo a fundamentação geométrica a uma fração da latência anterior. No estudo empírico mais extenso de qualquer VLA aberto até hoje, abrangendo 7 benchmarks de simulação e mundo real, o MolmoAct2 supera baselines fortes incluindo o Pi-05, enquanto o MolmoER supera o GPT-5 e o Gemini Robotics ER-1.5 em 13 benchmarks de raciocínio corporificado. Lançamos os pesos do modelo, código de treinamento e dados completos de treinamento. Página do projeto: https://allenai.org/blog/molmoact2
English
Vision-Language-Action (VLA) models aim to provide a single generalist controller for robots, but today's systems fall short on the criteria that matter for real-world deployment. Frontier models are closed, open-weight alternatives are tied to expensive hardware, reasoning-augmented policies pay prohibitive latency for their grounding, and fine-tuned success rates remain below the threshold for dependable use. We present MolmoAct2, a fully open action reasoning model built for practical deployment, advancing its predecessor along five axes. We introduce MolmoER, a VLM backbone specialized for spatial and embodied reasoning, trained on a 3.3M-sample corpus with a specialize-then-rehearse recipe. We release three new datasets spanning low-to-medium cost platforms, including MolmoAct2-BimanualYAM, 720 hours of teleoperated bimanual trajectories that constitute the largest open bimanual dataset to date, together with quality-filtered Franka (DROID) and SO100/101 subsets. We provide OpenFAST, an open-weight, open-data action tokenizer trained on millions of trajectories across five embodiments. We redesign the architecture to graft a flow-matching continuous-action expert onto a discrete-token VLM via per-layer KV-cache conditioning. Finally, we propose MolmoThink, an adaptive-depth reasoning variant that re-predicts depth tokens only for scene regions that change between timesteps, retaining geometric grounding at a fraction of prior latency. In the most extensive empirical study of any open VLA to date, spanning 7 simulation and real-world benchmarks, MolmoAct2 outperforms strong baselines including Pi-05, while MolmoER surpasses GPT-5 and Gemini Robotics ER-1.5 across 13 embodied-reasoning benchmarks. We release model weights, training code, and complete training data. Project page: https://allenai.org/blog/molmoact2