RoboTALES : Apprentissage de politiques robotiques guidées par le raisonnement via des futurs simulés alignés sur les tâches
RoboTALES: Learning Reasoning-Guided Robot Policies via Task-Aligned Simulated Futures
July 7, 2026
Auteurs: Hanan Gani, Tejal Kulkarni, Madhoolika Chodavarapu, Nicklas Hansen, Manmohan Chandraker
cs.AI
Résumé
Les modèles génératifs vidéo pré-entraînés constituent des architectures prometteuses pour le contrôle visuomoteur, mais leurs futurs imaginés s'écartent souvent de l'intention de la tâche et ne sont pas conditionnés de manière fiable par l'action. Par conséquent, ces modèles peuvent être difficiles à utiliser pour la planification ou l'extraction de politiques. Pour remédier à ces limitations, nous proposons RoboTALES, un cadre en une seule étape qui apprend des futurs simulés alignés sur la tâche et les utilise pour entraîner des politiques robotiques. Notre approche introduit deux innovations clés : (1) un planificateur hiérarchique basé sur LLM qui décompose les tâches complexes en une séquence de sous-objectifs pour guider l'imagination du modèle ; et (2) un critique basé sur VLM qui évalue ces futurs « imaginés » et utilise un retour basé sur les récompenses pour maintenir les représentations internes du modèle centrées sur l'objectif. En ancrant le générateur vidéo dans un raisonnement abstrait, nous produisons des déroulements temporellement cohérents et des actions plus cohérentes. Nous évaluons RoboTALES sur diverses tâches de manipulation issues de RoboCasa et LIBERO10, et montrons que notre méthode surpasse systématiquement les méthodes existantes, en particulier dans les tâches à long horizon. Notre code et nos modèles sont disponibles publiquement à l'adresse https://github.com/hananshafi/RoboTALES.
English
Pretrained video generative models are promising backbones for visuomotor control, but their imagined futures often drift from task intent and are not reliably action-conditional. As a result, these models can be difficult to use for planning or policy extraction. To address these limitations, we propose RoboTALES, a single-stage framework that learns task-aligned simulated futures and uses them to train robot policies. Our approach introduces two key innovations: (1) a hierarchical LLM-based planner that breaks complex tasks into a sequence of subgoals to guide the model's imagination; and (2) a VLM-based critic that evaluates these ``imagined'' futures and uses reward-based feedback to keep the model's internal representations focused on the goal. By anchoring the video generator in abstract reasoning, we produce temporally consistent rollouts and more coherent actions. We evaluate RoboTALES on diverse manipulation tasks from RoboCasa and LIBERO10, and show that our method consistently outperforms existing methods, especially in long-horizon tasks. Our code and models are publicly available at https://github.com/hananshafi/RoboTALES.