**Quando Confiar na Imaginação: Execução Adaptativa de Ações para Modelos de Ação no Mundo**
When to Trust Imagination: Adaptive Action Execution for World Action Models
May 7, 2026
Autores: Rui Wang, Yue Zhang, Jiehong Lin, Kuncheng Luo, Jianan Wang, Zhongrui Wang, Xiaojuan Qi
cs.AI
Resumo
Os Modelos de Ação Mundial (WAMs) emergiram recentemente como um paradigma promissor para a manipulação robótica, prevendo conjuntamente observações visuais futuras e ações futuras. No entanto, os WAMs atuais normalmente executam um número fixo de ações previstas após cada inferência do modelo, deixando o roboto cego quanto à consistência entre o futuro imaginado e a execução física real. Neste trabalho, formulamos a execução adaptativa de WAMs como um problema de verificação futuro-realidade: o robô deve executar por mais tempo quando o futuro previsto pelo WAM permanece confiável e replanejar mais cedo quando a realidade se desvia da imaginação. Para isso, propomos o Future Forward Dynamics Causal Attention (FFDC), um verificador leve que raciocina conjuntamente sobre ações futuras previstas, dinâmicas visuais previstas, observações reais e instruções de linguagem para estimar se a execução das ações restantes ainda pode ser confiável. O FFDC permite tamanhos de chunk de ação adaptativos como uma consequência emergente da consistência previsão-observação, preservando a eficiência da execução de longo horizonte enquanto restaura a responsividade em fases ricas em contato ou difíceis. Introduzimos ainda o Mixture-of-Horizon Training para melhorar a cobertura de trajetórias de longo horizonte para execução adaptativa. Experimentos no benchmark RoboTwin e no mundo real demonstram que nosso método alcança um forte equilíbrio entre robustez e eficiência: no RoboTwin, reduz as passagens diretas do WAM em 69,10% e o tempo de execução em 34,02%, enquanto melhora a taxa de sucesso em 2,54% em relação à baseline de chunk curto; em experimentos do mundo real, melhora a taxa de sucesso em 35%.
English
World Action Models (WAMs) have recently emerged as a promising paradigm for robotic manipulation by jointly predicting future visual observations and future actions. However, current WAMs typically execute a fixed number of predicted actions after each model inference, leaving the robot blind to whether the imagined future remains consistent with the actual physical rollout. In this work, we formulate adaptive WAM execution as a future-reality verification problem: the robot should execute longer when the WAM-predicted future remains reliable, and replan earlier when reality deviates from imagination. To this end, we propose Future Forward Dynamics Causal Attention (FFDC), a lightweight verifier that jointly reasons over predicted future actions, predicted visual dynamics, real observations, and language instructions to estimate whether the remaining action rollout can still be trusted. FFDC enables adaptive action chunk sizes as an emergent consequence of prediction-observation consistency, preserving the efficiency of long-horizon execution while restoring responsiveness in contact-rich or difficult phases. We further introduce Mixture-of-Horizon Training to improve long-horizon trajectory coverage for adaptive execution. Experiments on the RoboTwin benchmark and in the real world demonstrate that our method achieves a strong robustness-efficiency trade-off: on RoboTwin, it reduces WAM forward passes by 69.10% and execution time by 34.02%, while improving success rate by 2.54% over the short-chunk baseline; in real-world experiments, it improves success rate by 35%.