ChatPaper.aiChatPaper

Aprendizagem de Priores de Dinâmica Transferíveis da Ação para a Modelagem do Mundo

Learning Transferable Dynamics Priors from Action to World Modeling

June 28, 2026
Autores: Ze Huang, Jiahui Zhang, Hairuo Liu, Chenxi Zhang, Ran Cheng, Li Zhang
cs.AI

Resumo

Estudamos a modelagem do mundo condicionada à ação como uma forma escalável de aprender prioris dinâmicas transferíveis para a aprendizagem robótica. Ao pré-treinar um modelo para prever como as ações direcionam a evolução da cena visual, o modelo de mundo resultante captura dinâmicas de interação reutilizáveis além da geração de vídeos no nível de aparência. Concretamente, pré-treinamos um modelo de mundo difusivo base interativo multivisual, A2World, em dados de manipulação robótica em larga escala com anotações reais de ações. Validamos as prioris dinâmicas aprendidas a partir de duas perspectivas complementares. Primeiro, adaptamos o A2World em um simulador do mundo real especializado em tarefas ou cenas, A2World-sim, cujas trajetórias de longo horizonte suportam a avaliação de políticas baseada em simulador e análise escalável de cenários hipotéticos, substituindo simulações com robô real por simulações com o modelo de mundo. Segundo, partindo dos mesmos pesos pré-treinados, adaptamos o A2World em um modelo de predição conjunta de vídeo-ação, A2World-policy, que prevê ações sob condicionamento visual e instrucional. Experimentos em benchmarks de simulação e cenários com robôs reais demonstram que o pré-treinamento do modelo de mundo condicionado à ação produz prioris dinâmicas transferíveis que beneficiam tanto a aprendizagem robótica centrada no simulador quanto a centrada na política.
English
We study action-conditioned world modeling as a scalable way to learn transferable dynamics priors for robot learning. By pretraining a model to predict how actions drive visual scene evolution, the resulting world model captures reusable interaction dynamics beyond appearance-level video generation. Concretely, we pretrain a multi-view interactive base diffusion world model, A2World, on large-scale robot manipulation data with real action annotations. We validate the learned dynamics priors from two complementary perspectives. First, we adapt A2World into a task- or scene-specialized real-world simulator, A2World-sim, whose long-horizon rollouts support simulator-based policy evaluation and scalable what-if analysis by replacing real-robot rollouts with world model rollouts. Second, starting from the same pretrained weights, we adapt A2World into a video-action joint prediction model, A2World-policy, that predicts actions under visual and instruction conditioning. Experiments across simulation benchmarks and real-robot settings demonstrate that action-conditioned world model pretraining yields transferable dynamics priors that benefit both simulator-centric and policy-centric robot learning.