ChatPaper.aiChatPaper

RoboTALES: Aprendizaje de Políticas de Robot Guiadas por Razonamiento a través de Futuros Simulados Alineados con la Tarea

RoboTALES: Learning Reasoning-Guided Robot Policies via Task-Aligned Simulated Futures

July 7, 2026
Autores: Hanan Gani, Tejal Kulkarni, Madhoolika Chodavarapu, Nicklas Hansen, Manmohan Chandraker
cs.AI

Resumen

Los modelos generativos de video preentrenados son prometedores como bases para el control visuomotor, pero sus futuros imaginados a menudo se desvían de la intención de la tarea y no son condicionales a la acción de manera fiable. Como resultado, estos modelos pueden ser difíciles de usar para la planificación o la extracción de políticas. Para abordar estas limitaciones, proponemos RoboTALES, un marco de una sola etapa que aprende futuros simulados alineados con la tarea y los utiliza para entrenar políticas robóticas. Nuestro enfoque introduce dos innovaciones clave: (1) un planificador jerárquico basado en LLM que descompone tareas complejas en una secuencia de subobjetivos para guiar la imaginación del modelo; y (2) un crítico basado en VLM que evalúa estos futuros "imaginados" y utiliza retroalimentación basada en recompensas para mantener las representaciones internas del modelo centradas en el objetivo. Al anclar el generador de video en el razonamiento abstracto, producimos despliegues temporalmente consistentes y acciones más coherentes. Evaluamos RoboTALES en diversas tareas de manipulación de RoboCasa y LIBERO10, y mostramos que nuestro método supera consistentemente a los métodos existentes, especialmente en tareas de horizonte largo. Nuestro código y modelos están disponibles públicamente en https://github.com/hananshafi/RoboTALES.
English
Pretrained video generative models are promising backbones for visuomotor control, but their imagined futures often drift from task intent and are not reliably action-conditional. As a result, these models can be difficult to use for planning or policy extraction. To address these limitations, we propose RoboTALES, a single-stage framework that learns task-aligned simulated futures and uses them to train robot policies. Our approach introduces two key innovations: (1) a hierarchical LLM-based planner that breaks complex tasks into a sequence of subgoals to guide the model's imagination; and (2) a VLM-based critic that evaluates these ``imagined'' futures and uses reward-based feedback to keep the model's internal representations focused on the goal. By anchoring the video generator in abstract reasoning, we produce temporally consistent rollouts and more coherent actions. We evaluate RoboTALES on diverse manipulation tasks from RoboCasa and LIBERO10, and show that our method consistently outperforms existing methods, especially in long-horizon tasks. Our code and models are publicly available at https://github.com/hananshafi/RoboTALES.