ChatPaper.aiChatPaper

RoboTTT: Escalado de Contexto para Políticas de Robots

RoboTTT: Context Scaling for Robot Policies

July 16, 2026
Autores: Yunfan Jiang, Yevgen Chebotar, Ruijie Zheng, Fengyuan Hu, Yunhao Ge, Jimmy Wu, Tianyuan Dai, Scott Reed, Li Fei-Fei, Yuke Zhu, Linxi "Jim" Fan
cs.AI

Resumen

Los modelos fundamentales de robots recientes operan con un contexto visomotor de un solo paso o de historia corta. Presentamos Políticas de Robots con Entrenamiento en Tiempo de Prueba (RoboTTT), un modelo de robot y una receta de entrenamiento que escalan el contexto visomotor a 8 mil pasos de tiempo, tres órdenes de magnitud más allá de las políticas de última generación, sin aumentar la latencia de inferencia. Con esta longitud de contexto, desbloqueamos nuevas capacidades robóticas: imitación en contexto de un solo disparo a partir de demostraciones humanas en video, mejora de políticas sobre la marcha, robustez frente a perturbaciones y un rendimiento superior en tareas de múltiples etapas y largo horizonte. También observamos, por primera vez, mejoras constantes en el rendimiento en lazo cerrado a medida que se escala la longitud del contexto de preentrenamiento. En esencia, RoboTTT integra el Entrenamiento en Tiempo de Prueba en modelos fundamentales de robots, como las políticas de visión-lenguaje-acción, dando lugar a un modelo secuencial cuyo estado recurrente consiste en pesos rápidos, parámetros actualizados mediante descenso de gradiente tanto durante el entrenamiento como durante la inferencia, comprimiendo historiales en el espacio de pesos y recuperando información contextual para el condicionamiento de contexto largo. Para escalar la longitud del contexto de entrenamiento, la receta combina el forzado de acciones secuenciales con la retropropagación truncada a través del tiempo. En tareas desafiantes de manipulación robótica en el mundo real, RoboTTT mejora el rendimiento general en un 87 % en comparación con la línea base de contexto de un solo paso, y completa por completo una tarea de ensamblaje de cinco minutos y diez etapas, algo que ninguna línea base logra. RoboTTT entrenado con contexto de 8 mil pasos supera al mismo modelo preentrenado con 1000 pasos en un 62 %, lo que sugiere que la longitud del contexto es un nuevo eje de escalado para los modelos fundamentales de robots. Los videos están disponibles en https://research.nvidia.com/labs/gear/robottt/
English
Recent robot foundation models operate with single-step or short-history visuomotor context. We introduce Test-Time-Training Robot Policies (RoboTTT), a robot model and training recipe that scale visuomotor context to 8K timesteps, three orders of magnitude beyond state-of-the-art policies, without growing inference latency. At this context length, we unlock new robot capabilities: one-shot in-context imitation from human video demonstrations, on-the-fly policy improvement, robustness to perturbations, and stronger performance on multi-stage, long-horizon tasks. We also observe, for the first time, steady gains in closed-loop performance as pretraining context length scales. At its core, RoboTTT integrates Test-Time Training into robot foundation models such as Vision-Language-Action policies, yielding a sequence model whose recurrent state consists of fast weights, parameters updated by gradient descent during both training and inference, compressing histories into weight space and retrieving contextual information for long-context conditioning. To scale training context length, the recipe combines sequence action forcing with truncated backpropagation through time. On challenging real-robot manipulation tasks, RoboTTT improves overall performance by 87% over the single-step context baseline and fully completes a five-minute, ten-stage assembly task, which no baseline ever does. RoboTTT trained with 8K-timestep context outperforms the same model pretrained with 1K timesteps by 62%, suggesting context length as a new scaling axis for robot foundation models. Videos are available at https://research.nvidia.com/labs/gear/robottt/