ChatPaper.aiChatPaper

RoboTTT: Масштабирование контекста для политик роботов

RoboTTT: Context Scaling for Robot Policies

July 16, 2026
Авторы: Yunfan Jiang, Yevgen Chebotar, Ruijie Zheng, Fengyuan Hu, Yunhao Ge, Jimmy Wu, Tianyuan Dai, Scott Reed, Li Fei-Fei, Yuke Zhu, Linxi "Jim" Fan
cs.AI

Аннотация

Современные фундаментальные модели роботов работают с одношаговым или краткосрочным визомоторным контекстом. Мы представляем RoboTTT (Test-Time-Training Robot Policies) — модель робота и методику обучения, которые масштабируют визомоторный контекст до 8 тысяч временных шагов, что на три порядка превышает возможности современных политик, при этом без увеличения задержки вывода. При такой длине контекста мы открываем новые возможности для роботов: однократное внутриконтекстное имитационное обучение по видеодемонстрациям человека, оперативное улучшение политики, устойчивость к возмущениям и более высокую производительность в многоэтапных задачах с длинным горизонтом. Мы также впервые наблюдаем устойчивый прирост эффективности замкнутого управления по мере масштабирования длины контекста предобучения. В основе RoboTTT лежит интеграция обучения во время тестирования (Test-Time Training) в фундаментальные модели роботов, такие как политики "видение-язык-действие", что дает модель последовательности, рекуррентное состояние которой состоит из быстрых весов — параметров, обновляемых градиентным спуском как во время обучения, так и во время вывода; это сжимает историю в пространство весов и извлекает контекстную информацию для длинного контекста. Для масштабирования длины контекста обучения методика объединяет принуждение к выполнению последовательности действий с усеченным обратным распространением во времени. В сложных задачах управления реальными роботами RoboTTT улучшает общую производительность на 87% по сравнению с базовым одношаговым контекстом и полностью выполняет пятиминутную десятиэтапную задачу сборки, которую не выполняет ни один базовый метод. RoboTTT, обученный с контекстом в 8 тысяч шагов, превосходит ту же модель, предобученную с контекстом в 1 тысячу шагов, на 62%, что указывает на длину контекста как новую ось масштабирования для фундаментальных моделей роботов. Видео доступны по адресу https://research.nvidia.com/labs/gear/robottt/
English
Recent robot foundation models operate with single-step or short-history visuomotor context. We introduce Test-Time-Training Robot Policies (RoboTTT), a robot model and training recipe that scale visuomotor context to 8K timesteps, three orders of magnitude beyond state-of-the-art policies, without growing inference latency. At this context length, we unlock new robot capabilities: one-shot in-context imitation from human video demonstrations, on-the-fly policy improvement, robustness to perturbations, and stronger performance on multi-stage, long-horizon tasks. We also observe, for the first time, steady gains in closed-loop performance as pretraining context length scales. At its core, RoboTTT integrates Test-Time Training into robot foundation models such as Vision-Language-Action policies, yielding a sequence model whose recurrent state consists of fast weights, parameters updated by gradient descent during both training and inference, compressing histories into weight space and retrieving contextual information for long-context conditioning. To scale training context length, the recipe combines sequence action forcing with truncated backpropagation through time. On challenging real-robot manipulation tasks, RoboTTT improves overall performance by 87% over the single-step context baseline and fully completes a five-minute, ten-stage assembly task, which no baseline ever does. RoboTTT trained with 8K-timestep context outperforms the same model pretrained with 1K timesteps by 62%, suggesting context length as a new scaling axis for robot foundation models. Videos are available at https://research.nvidia.com/labs/gear/robottt/