ChatPaper.aiChatPaper

ACID: Consistência de Ação via Dinâmica Inversa para Planejamento com Modelos de Mundo

ACID: Action Consistency via Inverse Dynamics for Planning with World Models

July 2, 2026
Autores: Gawon Seo, Dongwon Kim, Suha Kwak
cs.AI

Resumo

O planejamento em tempo de decisão com modelos de mundo condicionados por ação tornou-se um paradigma popular para controle encarnado. No entanto, o custo de planejamento padrão julga um candidato apenas por quão próximo seu estado terminal previsto está do objetivo, deixando a realizabilidade das transições intermediárias sem verificação — uma trajetória prevista pode parecer convincente enquanto a simulação do ambiente se desvia dela. Neste artigo, propomos ACID, uma estrutura de planejamento em tempo de decisão que introduz consistência de ação cíclica: a ação inferida retroativamente a partir de uma transição prevista por um modelo de dinâmica inversa deve recuperar aquela que foi condicionada. Incorporamos este resíduo por passo no custo de planejamento por meio de um peso adaptativo invariante à escala. Em quatro modelos de mundo condicionados por ação e seis tarefas abrangendo manipulação rígida e deformável, controle articulado e navegação visual, ACID melhora consistentemente o planejamento e iguala a precisão da linha de base com substancialmente menos custo computacional de planejamento.
English
Decision-time planning with action-conditioned world models has become a popular paradigm for embodied control. However, the standard planning cost judges a candidate solely by how close its predicted terminal state lies to the goal, leaving the realizability of the intermediate transitions unchecked -- a predicted trajectory can look convincing while the environment rollout drifts away from it. In this paper, we propose ACID, a decision-time planning framework that introduces cycle action consistency: the action inferred backward from a predicted transition by an inverse dynamics model should recover the one that was conditioned on. We fold this per-step residual into the planning cost via a scale-invariant adaptive weight. Across four action-conditioned world models and six tasks spanning rigid and deformable manipulation, articulated control, and visual navigation, ACID consistently improves planning and matches the baseline's accuracy with substantially less planning compute.