ACID: Consistencia de Acciones mediante Dinámica Inversa para Planificación con Modelos del Mundo
ACID: Action Consistency via Inverse Dynamics for Planning with World Models
July 2, 2026
Autores: Gawon Seo, Dongwon Kim, Suha Kwak
cs.AI
Resumen
La planificación en tiempo de decisión con modelos del mundo condicionados por la acción se ha convertido en un paradigma popular para el control encarnado. Sin embargo, el costo de planificación estándar evalúa un candidato únicamente por lo cerca que está su estado terminal predicho del objetivo, dejando sin verificar la realizabilidad de las transiciones intermedias — una trayectoria predicha puede parecer convincente mientras que la ejecución del entorno se desvía de ella. En este artículo, proponemos ACID, un marco de planificación en tiempo de decisión que introduce la consistencia de acción cíclica: la acción inferida hacia atrás a partir de una transición predicha por un modelo de dinámica inversa debe recuperar aquella que fue condicionada. Integramos este residual paso a paso en el costo de planificación mediante un peso adaptativo invariante a la escala. En cuatro modelos del mundo condicionados por la acción y seis tareas que abarcan manipulación rígida y deformable, control articulado y navegación visual, ACID mejora consistentemente la planificación y alcanza la precisión de la línea base con considerablemente menos cómputo de planificación.
English
Decision-time planning with action-conditioned world models has become a popular paradigm for embodied control. However, the standard planning cost judges a candidate solely by how close its predicted terminal state lies to the goal, leaving the realizability of the intermediate transitions unchecked -- a predicted trajectory can look convincing while the environment rollout drifts away from it. In this paper, we propose ACID, a decision-time planning framework that introduces cycle action consistency: the action inferred backward from a predicted transition by an inverse dynamics model should recover the one that was conditioned on. We fold this per-step residual into the planning cost via a scale-invariant adaptive weight. Across four action-conditioned world models and six tasks spanning rigid and deformable manipulation, articulated control, and visual navigation, ACID consistently improves planning and matches the baseline's accuracy with substantially less planning compute.