RoboTTT: Kontextskalierung für Roboterrichtlinien
RoboTTT: Context Scaling for Robot Policies
July 16, 2026
Autoren: Yunfan Jiang, Yevgen Chebotar, Ruijie Zheng, Fengyuan Hu, Yunhao Ge, Jimmy Wu, Tianyuan Dai, Scott Reed, Li Fei-Fei, Yuke Zhu, Linxi "Jim" Fan
cs.AI
Zusammenfassung
Neuere Robotik-Grundlagenmodelle arbeiten mit ein- oder kurzfristigem visuomotorischem Kontext. Wir stellen Test-Time-Training Robot Policies (RoboTTT) vor, ein Robotermodell und eine Trainingsmethode, die den visuomotorischen Kontext auf 8K Zeitschritte skalieren – drei Größenordnungen über dem Stand der Technik liegender Policys – ohne die Inferenzlatenz zu erhöhen. Bei dieser Kontextlänge erschließen wir neue Roboterfähigkeiten: einmalige kontextabhängige Imitation aus menschlichen Videodemonstrationen, Online-Verbesserung der Policy, Robustheit gegenüber Störungen und höhere Leistung bei mehrstufigen, langfristigen Aufgaben. Wir beobachten zudem erstmals stetige Verbesserungen der Closed-Loop-Leistung mit zunehmender Kontextlänge des Vortrainings. Im Kern integriert RoboTTT Test-Time Training in Robotik-Grundlagenmodelle wie Vision-Language-Action-Policys, was zu einem Sequenzmodell führt, dessen wiederkehrender Zustand aus schnellen Gewichten besteht – Parameter, die während Training und Inferenz durch Gradientenabstieg aktualisiert werden –, um Historien in den Gewichtsraum zu komprimieren und kontextuelle Informationen für die Konditionierung auf langen Kontext abzurufen. Um die Trainingskontextlänge zu skalieren, kombiniert die Methode Sequenz-Action-Forcing mit abgeschnittenem Backpropagation durch die Zeit. Bei anspruchsvollen realen Manipulationsaufgaben verbessert RoboTTT die Gesamtleistung um 87 % gegenüber der Baseline mit Ein-Schritt-Kontext und schließt eine fünfminütige, zehnstufige Montageaufgabe vollständig ab, was keine Baseline je erreicht. RoboTTT, trainiert mit 8K-Zeitschritt-Kontext, übertrifft dasselbe mit 1K Zeitschritten vortrainierte Modell um 62 %, was darauf hindeutet, dass die Kontextlänge eine neue Skalierungsachse für Robotik-Grundlagenmodelle darstellt. Videos sind verfügbar unter https://research.nvidia.com/labs/gear/robottt/
English
Recent robot foundation models operate with single-step or short-history visuomotor context. We introduce Test-Time-Training Robot Policies (RoboTTT), a robot model and training recipe that scale visuomotor context to 8K timesteps, three orders of magnitude beyond state-of-the-art policies, without growing inference latency. At this context length, we unlock new robot capabilities: one-shot in-context imitation from human video demonstrations, on-the-fly policy improvement, robustness to perturbations, and stronger performance on multi-stage, long-horizon tasks. We also observe, for the first time, steady gains in closed-loop performance as pretraining context length scales. At its core, RoboTTT integrates Test-Time Training into robot foundation models such as Vision-Language-Action policies, yielding a sequence model whose recurrent state consists of fast weights, parameters updated by gradient descent during both training and inference, compressing histories into weight space and retrieving contextual information for long-context conditioning. To scale training context length, the recipe combines sequence action forcing with truncated backpropagation through time. On challenging real-robot manipulation tasks, RoboTTT improves overall performance by 87% over the single-step context baseline and fully completes a five-minute, ten-stage assembly task, which no baseline ever does. RoboTTT trained with 8K-timestep context outperforms the same model pretrained with 1K timesteps by 62%, suggesting context length as a new scaling axis for robot foundation models. Videos are available at https://research.nvidia.com/labs/gear/robottt/