World Action-modellen: De volgende grens in Embodied AI
World Action Models: The Next Frontier in Embodied AI
May 12, 2026
Auteurs: Siyin Wang, Junhao Shi, Zhaoyang Fu, Xinzhe He, Feihong Liu, Chenchen Yang, Yikang Zhou, Zhaoye Fei, Jingjing Gong, Jinlan Fu, Mike Zheng Shou, Xuanjing Huang, Xipeng Qiu, Yu-Gang Jiang
cs.AI
Samenvatting
Visie-taal-actie (VLA)-modellen hebben een sterke semantische generalisatie bereikt voor belichaamd beleidsleren, maar ze leren reactieve observatie-naar-actie-toewijzingen zonder expliciet te modelleren hoe de fysieke wereld evolueert onder interventie. Een groeiend aantal onderzoeken pakt deze beperking aan door wereldmodellen, voorspellende modellen van omgevingsdynamiek, te integreren in de pijplijn voor actiegeneratie. We noemen dit opkomende paradigma World Action Models (WAM's): belichaamde funderingsmodellen die voorspellende toestandsmodellering verenigen met actiegeneratie, gericht op een gezamenlijke verdeling over toekomstige toestanden en acties in plaats van alleen acties. De literatuur blijft echter gefragmenteerd over architecturen, leerdoelstellingen en toepassingsscenario's, zonder een uniform conceptueel raamwerk. We definiëren WAM's formeel en ontwarren ze van gerelateerde concepten, en traceren de fundamenten en vroege integratie van VLA- en wereldmodelonderzoek die aanleiding gaven tot dit paradigma. We organiseren bestaande methoden in een gestructureerde taxonomie van gecascadeerde en gezamenlijke WAM's, met verdere onderverdeling naar generatiemodaliteit, conditioneringsmechanisme en actie-decoderingstrategie. We analyseren systematisch het data-ecosysteem dat de ontwikkeling van WAM's voedt, variërend van robot-teleoperatie, draagbare menselijke demonstraties, simulatie en internet-schaal egocentrische video, en synthetiseren opkomende evaluatieprotocollen die zijn georganiseerd rond visuele getrouwheid, fysiek gezond verstand en actieplausibiliteit. Over het geheel genomen biedt dit overzicht de eerste systematische beschrijving van het WAM-landschap, verduidelijkt het belangrijke architectuurparadigma's en hun afwegingen, en identificeert het open uitdagingen en toekomstige kansen voor dit snel evoluerende vakgebied.
English
Vision-Language-Action (VLA) models have achieved strong semantic generalization for embodied policy learning, yet they learn reactive observation-to-action mappings without explicitly modeling how the physical world evolves under intervention. A growing body of work addresses this limitation by integrating world models, predictive models of environment dynamics, into the action generation pipeline. We term this emerging paradigm World Action Models (WAMs): embodied foundation models that unify predictive state modeling with action generation, targeting a joint distribution over future states and actions rather than actions alone. However, the literature remains fragmented across architectures, learning objectives, and application scenarios, lacking a unified conceptual framework. We formally define WAMs and disambiguate them from related concepts, and trace the foundations and early integration of VLA and world model research that gave rise to this paradigm. We organize existing methods into a structured taxonomy of Cascaded and Joint WAMs, with further subdivision by generation modality, conditioning mechanism, and action decoding strategy. We systematically analyze the data ecosystem fueling WAMs development, spanning robot teleoperation, portable human demonstrations, simulation, and internet-scale egocentric video, and synthesize emerging evaluation protocols organized around visual fidelity, physical commonsense, and action plausibility. Overall, this survey provides the first systematic account of the WAMs landscape, clarifies key architectural paradigms and their trade-offs, and identifies open challenges and future opportunities for this rapidly evolving field.