RoboTALES: Aprendizagem de Políticas de Robô Orientadas por Raciocínio via Futuros Simulados Alinhados à Tarefa
RoboTALES: Learning Reasoning-Guided Robot Policies via Task-Aligned Simulated Futures
July 7, 2026
Autores: Hanan Gani, Tejal Kulkarni, Madhoolika Chodavarapu, Nicklas Hansen, Manmohan Chandraker
cs.AI
Resumo
Modelos generativos de vídeo pré-treinados são fundações promissoras para o controle visuomotor, mas seus futuros imaginados frequentemente se desviam da intenção da tarefa e não são confiavelmente condicionais à ação. Consequentemente, esses modelos podem ser difíceis de usar para planejamento ou extração de políticas. Para superar essas limitações, propomos o RoboTALES, uma estrutura de estágio único que aprende futuros simulados alinhados à tarefa e os utiliza para treinar políticas robóticas. Nossa abordagem introduz duas inovações principais: (1) um planejador hierárquico baseado em LLM que divide tarefas complexas em uma sequência de subobjetivos para guiar a imaginação do modelo; e (2) um crítico baseado em VLM que avalia esses futuros "imaginados" e utiliza feedback baseado em recompensa para manter as representações internas do modelo focadas no objetivo. Ao ancorar o gerador de vídeo em raciocínio abstrato, produzimos rollouts temporalmente consistentes e ações mais coerentes. Avaliamos o RoboTALES em diversas tarefas de manipulação do RoboCasa e LIBERO10, e mostramos que nosso método supera consistentemente os métodos existentes, especialmente em tarefas de longo horizonte. Nosso código e modelos estão disponíveis publicamente em https://github.com/hananshafi/RoboTALES.
English
Pretrained video generative models are promising backbones for visuomotor control, but their imagined futures often drift from task intent and are not reliably action-conditional. As a result, these models can be difficult to use for planning or policy extraction. To address these limitations, we propose RoboTALES, a single-stage framework that learns task-aligned simulated futures and uses them to train robot policies. Our approach introduces two key innovations: (1) a hierarchical LLM-based planner that breaks complex tasks into a sequence of subgoals to guide the model's imagination; and (2) a VLM-based critic that evaluates these ``imagined'' futures and uses reward-based feedback to keep the model's internal representations focused on the goal. By anchoring the video generator in abstract reasoning, we produce temporally consistent rollouts and more coherent actions. We evaluate RoboTALES on diverse manipulation tasks from RoboCasa and LIBERO10, and show that our method consistently outperforms existing methods, especially in long-horizon tasks. Our code and models are publicly available at https://github.com/hananshafi/RoboTALES.