ChatPaper.aiChatPaper

ACID: Согласованность действий посредством обратной динамики для планирования с мировыми моделями

ACID: Action Consistency via Inverse Dynamics for Planning with World Models

July 2, 2026
Авторы: Gawon Seo, Dongwon Kim, Suha Kwak
cs.AI

Аннотация

Планирование в реальном времени с использованием обусловленных действием моделей мира стало популярной парадигмой для воплощённого управления. Однако стандартная стоимость планирования оценивает кандидата исключительно по тому, насколько его прогнозируемое конечное состояние близко к цели, оставляя без проверки реализуемость промежуточных переходов: прогнозируемая траектория может выглядеть убедительно, тогда как реальное развёртывание среды отклоняется от неё. В данной работе мы предлагаем ACID — фреймворк для планирования в реальном времени, который вводит циклическую согласованность действий: действие, выведенное обратным образом из прогнозируемого перехода с помощью модели обратной динамики, должно восстанавливать то действие, на которое было произведено обусловливание. Мы сворачиваем эту пошаговую невязку в стоимость планирования с помощью масштабно-инвариантного адаптивного веса. На четырёх обусловленных действием моделях мира и шести задачах, охватывающих жёсткое и деформируемое манипулирование, шарнирное управление и визуальную навигацию, ACID последовательно улучшает планирование и достигает точности базового метода при существенно меньших вычислительных затратах на планирование.
English
Decision-time planning with action-conditioned world models has become a popular paradigm for embodied control. However, the standard planning cost judges a candidate solely by how close its predicted terminal state lies to the goal, leaving the realizability of the intermediate transitions unchecked -- a predicted trajectory can look convincing while the environment rollout drifts away from it. In this paper, we propose ACID, a decision-time planning framework that introduces cycle action consistency: the action inferred backward from a predicted transition by an inverse dynamics model should recover the one that was conditioned on. We fold this per-step residual into the planning cost via a scale-invariant adaptive weight. Across four action-conditioned world models and six tasks spanning rigid and deformable manipulation, articulated control, and visual navigation, ACID consistently improves planning and matches the baseline's accuracy with substantially less planning compute.