RoboTALES: Обучение управляемых рассуждением роботных политик с помощью согласованных с задачей симулированных будущих состояний
RoboTALES: Learning Reasoning-Guided Robot Policies via Task-Aligned Simulated Futures
July 7, 2026
Авторы: Hanan Gani, Tejal Kulkarni, Madhoolika Chodavarapu, Nicklas Hansen, Manmohan Chandraker
cs.AI
Аннотация
Предварительно обученные генеративные модели видео являются перспективными базовыми моделями для визуомоторного управления, однако их воображаемые будущие состояния часто отклоняются от цели задачи и не являются надежно обусловленными действиями. В результате такие модели могут быть сложны в использовании для планирования или извлечения политики. Для решения этих ограничений мы предлагаем RoboTALES — одноэтапную структуру, которая изучает согласованные с задачей симулированные будущие состояния и использует их для обучения роботизированных политик. Наш подход включает две ключевые инновации: (1) иерархический планировщик на основе LLM, который разбивает сложные задачи на последовательность подцелей, направляющих воображение модели; и (2) критик на основе VLM, оценивающий эти «воображаемые» будущие состояния и использующий вознаграждающую обратную связь для удержания внутренних представлений модели сфокусированными на цели. Закрепляя генератор видео за абстрактным рассуждением, мы получаем временно согласованные развертки и более когерентные действия. Мы оцениваем RoboTALES на различных задачах манипуляции из RoboCasa и LIBERO10 и показываем, что наш метод стабильно превосходит существующие подходы, особенно в задачах с большим горизонтом планирования. Наш код и модели общедоступны по адресу https://github.com/hananshafi/RoboTALES.
English
Pretrained video generative models are promising backbones for visuomotor control, but their imagined futures often drift from task intent and are not reliably action-conditional. As a result, these models can be difficult to use for planning or policy extraction. To address these limitations, we propose RoboTALES, a single-stage framework that learns task-aligned simulated futures and uses them to train robot policies. Our approach introduces two key innovations: (1) a hierarchical LLM-based planner that breaks complex tasks into a sequence of subgoals to guide the model's imagination; and (2) a VLM-based critic that evaluates these ``imagined'' futures and uses reward-based feedback to keep the model's internal representations focused on the goal. By anchoring the video generator in abstract reasoning, we produce temporally consistent rollouts and more coherent actions. We evaluate RoboTALES on diverse manipulation tasks from RoboCasa and LIBERO10, and show that our method consistently outperforms existing methods, especially in long-horizon tasks. Our code and models are publicly available at https://github.com/hananshafi/RoboTALES.