RoboTTT : Passage à l’échelle du contexte pour les politiques de robots
RoboTTT: Context Scaling for Robot Policies
July 16, 2026
Auteurs: Yunfan Jiang, Yevgen Chebotar, Ruijie Zheng, Fengyuan Hu, Yunhao Ge, Jimmy Wu, Tianyuan Dai, Scott Reed, Li Fei-Fei, Yuke Zhu, Linxi "Jim" Fan
cs.AI
Résumé
Les modèles fondamentaux de robotique récents fonctionnent avec un contexte visuomoteur à pas unique ou à historique court. Nous présentons les politiques robotiques avec entraînement au moment du test (RoboTTT), un modèle robotique et une méthode d'entraînement qui étendent le contexte visuomoteur jusqu'à 8 000 pas de temps, soit trois ordres de grandeur de plus que les politiques de pointe, sans augmenter la latence d'inférence. À cette longueur de contexte, nous débloquons de nouvelles capacités robotiques : imitation en contexte en un seul essai à partir de démonstrations vidéo humaines, amélioration des politiques à la volée, robustesse aux perturbations, et performances accrues sur des tâches multi-étapes et à long horizon. Nous observons également, pour la première fois, des gains constants dans les performances en boucle fermée à mesure que la longueur du contexte de pré-entraînement augmente. Au cœur de RoboTTT se trouve l'intégration de l'entraînement au moment du test dans les modèles fondamentaux de robotique, tels que les politiques Vision-Langage-Action, produisant un modèle séquentiel dont l'état récurrent est constitué de poids rapides, des paramètres mis à jour par descente de gradient pendant l'entraînement et l'inférence, compressant les historiques dans l'espace des poids et récupérant les informations contextuelles pour un conditionnement à long contexte. Pour augmenter la longueur du contexte d'entraînement, la méthode combine le forçage d'actions séquentielles avec la rétropropagation tronquée dans le temps. Sur des tâches de manipulation robotique réelles difficiles, RoboTTT améliore les performances globales de 87 % par rapport à la référence à contexte à pas unique et termine complètement une tâche d'assemblage de cinq minutes et dix étapes, ce qu'aucune référence ne parvient à faire. RoboTTT, entraîné avec un contexte de 8 000 pas de temps, surpasse le même modèle pré-entraîné avec 1 000 pas de temps de 62 %, suggérant que la longueur du contexte constitue un nouvel axe de passage à l'échelle pour les modèles fondamentaux de robotique. Les vidéos sont disponibles sur https://research.nvidia.com/labs/gear/robottt/
English
Recent robot foundation models operate with single-step or short-history visuomotor context. We introduce Test-Time-Training Robot Policies (RoboTTT), a robot model and training recipe that scale visuomotor context to 8K timesteps, three orders of magnitude beyond state-of-the-art policies, without growing inference latency. At this context length, we unlock new robot capabilities: one-shot in-context imitation from human video demonstrations, on-the-fly policy improvement, robustness to perturbations, and stronger performance on multi-stage, long-horizon tasks. We also observe, for the first time, steady gains in closed-loop performance as pretraining context length scales. At its core, RoboTTT integrates Test-Time Training into robot foundation models such as Vision-Language-Action policies, yielding a sequence model whose recurrent state consists of fast weights, parameters updated by gradient descent during both training and inference, compressing histories into weight space and retrieving contextual information for long-context conditioning. To scale training context length, the recipe combines sequence action forcing with truncated backpropagation through time. On challenging real-robot manipulation tasks, RoboTTT improves overall performance by 87% over the single-step context baseline and fully completes a five-minute, ten-stage assembly task, which no baseline ever does. RoboTTT trained with 8K-timestep context outperforms the same model pretrained with 1K timesteps by 62%, suggesting context length as a new scaling axis for robot foundation models. Videos are available at https://research.nvidia.com/labs/gear/robottt/