Modelos de Ação Mundial: A Próxima Fronteira da IA Incorporada
World Action Models: The Next Frontier in Embodied AI
May 12, 2026
Autores: Siyin Wang, Junhao Shi, Zhaoyang Fu, Xinzhe He, Feihong Liu, Chenchen Yang, Yikang Zhou, Zhaoye Fei, Jingjing Gong, Jinlan Fu, Mike Zheng Shou, Xuanjing Huang, Xipeng Qiu, Yu-Gang Jiang
cs.AI
Resumo
Modelos Visão-Linguagem-Ação (VLA) alcançaram forte generalização semântica para aprendizado de políticas incorporadas, porém aprendem mapeamentos reativos de observação para ação sem modelar explicitamente como o mundo físico evolui sob intervenção. Um conjunto crescente de trabalhos aborda essa limitação integrando modelos de mundo, modelos preditivos da dinâmica ambiental, ao pipeline de geração de ação. Denominamos esse paradigma emergente de Modelos de Ação-Mundo (WAMs): modelos fundamentais incorporados que unificam a modelagem preditiva de estados com a geração de ação, visando uma distribuição conjunta sobre estados e ações futuras, em vez de apenas ações. No entanto, a literatura permanece fragmentada entre arquiteturas, objetivos de aprendizado e cenários de aplicação, carecendo de um arcabouço conceitual unificado. Definimos formalmente os WAMs e os desambiguamos de conceitos relacionados, traçando as bases e a integração inicial das pesquisas em VLA e modelos de mundo que deram origem a esse paradigma. Organizamos os métodos existentes em uma taxonomia estruturada de WAMs em Cascata e Conjuntos, com subdivisão adicional por modalidade de geração, mecanismo de condicionamento e estratégia de decodificação de ação. Analisamos sistematicamente o ecossistema de dados que impulsiona o desenvolvimento dos WAMs, abrangendo teleoperação robótica, demonstrações humanas portáteis, simulação e vídeo egocêntrico em escala da internet, e sintetizamos protocolos de avaliação emergentes organizados em torno de fidelidade visual, senso comum físico e plausibilidade da ação. Em conjunto, este levantamento fornece o primeiro relato sistemático do cenário dos WAMs, esclarece paradigmas arquiteturais chave e suas compensações, e identifica desafios em aberto e oportunidades futuras para este campo em rápida evolução.
English
Vision-Language-Action (VLA) models have achieved strong semantic generalization for embodied policy learning, yet they learn reactive observation-to-action mappings without explicitly modeling how the physical world evolves under intervention. A growing body of work addresses this limitation by integrating world models, predictive models of environment dynamics, into the action generation pipeline. We term this emerging paradigm World Action Models (WAMs): embodied foundation models that unify predictive state modeling with action generation, targeting a joint distribution over future states and actions rather than actions alone. However, the literature remains fragmented across architectures, learning objectives, and application scenarios, lacking a unified conceptual framework. We formally define WAMs and disambiguate them from related concepts, and trace the foundations and early integration of VLA and world model research that gave rise to this paradigm. We organize existing methods into a structured taxonomy of Cascaded and Joint WAMs, with further subdivision by generation modality, conditioning mechanism, and action decoding strategy. We systematically analyze the data ecosystem fueling WAMs development, spanning robot teleoperation, portable human demonstrations, simulation, and internet-scale egocentric video, and synthesize emerging evaluation protocols organized around visual fidelity, physical commonsense, and action plausibility. Overall, this survey provides the first systematic account of the WAMs landscape, clarifies key architectural paradigms and their trade-offs, and identifies open challenges and future opportunities for this rapidly evolving field.