Modelos de Ação Mundial: Uma Revisão
World Action Models: A Survey
June 18, 2026
Autores: Qiuhong Shen, Shihua Zhang, Yue Liao, Qi Li, Zhenxiong Tan, Shizun Wang, Shuicheng Yan, Xinchao Wang
cs.AI
Resumo
Modelos de Ação Mundial (WAMs) são modelos preditivos de ação corporificados que disponibilizam uma previsão do futuro para a ação. WAMs recentes reaproveitam grandes modelos de geração de vídeo, e uma linha paralela depende de backbones de linguagem ou visão-linguagem sem um núcleo de geração de vídeo. Essa rápida expansão turvou a fronteira entre modelos mundiais amplos, modelos de geração de vídeo, modelos mundiais de vídeo fundamentados em ação, políticas de Visão-Linguagem-Ação e WAMs. Esta pesquisa oferece ao campo uma descrição comum. Primeiramente, esclarece essas fronteiras e, em seguida, organiza os trabalhos existentes por meio de duas perspectivas complementares. A primeira perspectiva questiona o que cada método precisa gerar, abrangendo futuros renderizados, futuros latentes e raciocínio de ação sem geração de vídeo. A segunda perspectiva decompõe cada método por substrato preditivo, backbone, acoplamento de ação e regime de implantação. Essa anatomia sustenta uma discussão unificada sobre interatividade, causalidade, persistência, plausibilidade física e generalização, seguida por dados, avaliação e desafios em aberto. Ao longo desses eixos, surge um padrão de design consistente: WAMs não são simplesmente geradores de vídeo com cabeças de ação, mas métodos de ação preditiva cujas escolhas de design equilibram riqueza representacional com custo computacional, de memória, latência e de rótulos de ação. O campo está avançando em direção a métodos que geram menos do futuro, preservando o que o controle requer. A página inicial da pesquisa está disponível em https://world-action-models.github.io/.
English
World Action Models (WAMs) are embodied predictive-action models that make a forecast of the future available to action. Recent WAMs repurpose large video generation models, and a parallel line relies on language or vision-language backbones without a video-generation core. This rapid expansion has blurred the boundary among broad world models, video generation models, action-grounded video world models, Vision-Language-Action policies, and WAMs. This survey gives the field a common account. It first clarifies these boundaries, then organizes existing works through two complementary views. The first view asks what each method is required to generate, spanning rendered futures, latent futures, and video-generation-free action reasoning. The second view decomposes each method by predictive substrate, backbone, action coupling, and deployment regime. This anatomy supports a unified discussion of interactability, causality, persistence, physical plausibility, and generalization, followed by data, evaluation, and open challenges. Across these axes, a consistent design pattern emerges: WAMs are not simply video generators with action heads, but predictive-action methods whose design choices trade representational richness against compute, memory, latency, and action-label cost. The field is moving toward methods that generate less of the future while preserving what control requires. The survey homepage is available at https://world-action-models.github.io/.