RoboTALES: Leren van redeneringsgestuurde robotstrategieën via taak-afgestemde gesimuleerde toekomsten
RoboTALES: Learning Reasoning-Guided Robot Policies via Task-Aligned Simulated Futures
July 7, 2026
Auteurs: Hanan Gani, Tejal Kulkarni, Madhoolika Chodavarapu, Nicklas Hansen, Manmohan Chandraker
cs.AI
Samenvatting
Voorgetrainde videogeneratieve modellen zijn veelbelovende basismodellen voor visuomotorische controle, maar hun voorgestelde toekomsten wijken vaak af van de taakintentie en zijn niet betrouwbaar actie-afhankelijk. Hierdoor zijn deze modellen moeilijk te gebruiken voor planning of beleidsextractie. Om deze beperkingen aan te pakken, introduceren we RoboTALES, een eenfasig raamwerk dat taakafgestemde gesimuleerde toekomsten leert en deze gebruikt om robotbeleid te trainen. Onze aanpak introduceert twee belangrijke innovaties: (1) een hiërarchische op LLM gebaseerde planner die complexe taken opsplitst in een reeks subdoelen om de verbeelding van het model te sturen; en (2) een op VLM gebaseerde criticus die deze 'voorgestelde' toekomsten evalueert en op beloning gebaseerde feedback gebruikt om de interne representaties van het model gefocust te houden op het doel. Door de videogenerator te verankeren in abstract redeneren, produceren we temporeel consistente uitrol en meer coherente acties. We evalueren RoboTALES op diverse manipulatie taken uit RoboCasa en LIBERO10, en tonen aan dat onze methode consequent beter presteert dan bestaande methoden, met name bij taken met een lange horizon. Onze code en modellen zijn openbaar beschikbaar op https://github.com/hananshafi/RoboTALES.
English
Pretrained video generative models are promising backbones for visuomotor control, but their imagined futures often drift from task intent and are not reliably action-conditional. As a result, these models can be difficult to use for planning or policy extraction. To address these limitations, we propose RoboTALES, a single-stage framework that learns task-aligned simulated futures and uses them to train robot policies. Our approach introduces two key innovations: (1) a hierarchical LLM-based planner that breaks complex tasks into a sequence of subgoals to guide the model's imagination; and (2) a VLM-based critic that evaluates these ``imagined'' futures and uses reward-based feedback to keep the model's internal representations focused on the goal. By anchoring the video generator in abstract reasoning, we produce temporally consistent rollouts and more coherent actions. We evaluate RoboTALES on diverse manipulation tasks from RoboCasa and LIBERO10, and show that our method consistently outperforms existing methods, especially in long-horizon tasks. Our code and models are publicly available at https://github.com/hananshafi/RoboTALES.