ChatPaper.aiChatPaper

ACID : Cohérence d'Action via Dynamique Inverse pour la Planification avec Modèles du Monde

ACID: Action Consistency via Inverse Dynamics for Planning with World Models

July 2, 2026
Auteurs: Gawon Seo, Dongwon Kim, Suha Kwak
cs.AI

Résumé

La planification en temps de décision avec des modèles du monde conditionnés par l'action est devenue un paradigme courant pour le contrôle incarné. Cependant, le coût de planification standard évalue un candidat uniquement en fonction de la proximité de son état terminal prédit par rapport à l'objectif, sans vérifier la réalisabilité des transitions intermédiaires — une trajectoire prédite peut sembler convaincante alors que le déroulement dans l'environnement s'en écarte. Dans cet article, nous proposons ACID, un cadre de planification en temps de décision qui introduit la cohérence cyclique des actions : l'action déduite rétrospectivement à partir d'une transition prédite par un modèle de dynamique inverse doit retrouver celle qui a été conditionnée. Nous intégrons ce résidu par pas dans le coût de planification via un poids adaptatif invariant à l'échelle. Sur quatre modèles du monde conditionnés par l'action et six tâches couvrant la manipulation d'objets rigides et déformables, le contrôle articulé et la navigation visuelle, ACID améliore systématiquement la planification et atteint la précision de la référence avec une charge de calcul de planification considérablement réduite.
English
Decision-time planning with action-conditioned world models has become a popular paradigm for embodied control. However, the standard planning cost judges a candidate solely by how close its predicted terminal state lies to the goal, leaving the realizability of the intermediate transitions unchecked -- a predicted trajectory can look convincing while the environment rollout drifts away from it. In this paper, we propose ACID, a decision-time planning framework that introduces cycle action consistency: the action inferred backward from a predicted transition by an inverse dynamics model should recover the one that was conditioned on. We fold this per-step residual into the planning cost via a scale-invariant adaptive weight. Across four action-conditioned world models and six tasks spanning rigid and deformable manipulation, articulated control, and visual navigation, ACID consistently improves planning and matches the baseline's accuracy with substantially less planning compute.