LongStraw: RL de Contexto Largo Más Allá de 2 Millones de Tokens Bajo un Presupuesto Fijo de GPU

LongStraw: Long-Context RL Beyond 2M Tokens under a Fixed GPU Budget

July 16, 2026
Autores: Changhai Zhou, Kieran Liu, Yuhua Zhou, Qian Qiao, Jun Gao, Harry Zhang, Irvine Lu, Nolan Ho, Lucian Li, Andrew Lei, Cleon Cheng, Steven Chiang, Yihang Zeng, Di Zhang, Rio Yang, Kaijie Chen, Andrew Chen, Pony Ma, Weizhong Zhang, Cheng Jin
cs.AI

Resumen

Una brecha creciente separa las longitudes de contexto de inferencia del post-entrenamiento con RL: los sistemas de inferencia se aproximan a contextos de un millón de tokens, mientras que las cargas de trabajo de post-entrenamiento a menudo se mantienen en 256K tokens o menos y dependen de la generalización de longitud durante el despliegue. Esta brecha es especialmente relevante para los agentes de IA, cuyas observaciones, salidas de herramientas, documentos y decisiones previas se acumulan a lo largo de trayectorias extensas. LongStraw es una pila de ejecución consciente de la arquitectura para el post-entrenamiento con RL de un millón de tokens bajo un presupuesto fijo de GPU, implementada con la Optimización de Política Relativa por Grupos (GRPO). Evalúa el prompt compartido sin autograd, retiene únicamente el estado específico del modelo necesario para los tokens posteriores, y reproduce las ramas de respuesta cortas una por una, reduciendo el grafo de entrenamiento en vivo a costa de un tiempo de reproducción adicional. Lo implementamos para el modelo híbrido recurrente y de atención completa Qwen3.6-27B y para la mezcla de expertos con atención comprimida GLM-5.2. En ocho GPUs H20, LongStraw completa el scoring y backward agrupados de Qwen en 2.1 millones de posiciones para grupos de 2 y 8; aumentar el tamaño del grupo agrega solo 0.21 GB de memoria pico asignada, mientras que una prueba de estrés independiente alcanza 4.46 millones de posiciones. En 32 GPUs H20, validamos la ruta de ejecución integral de LongStraw para un prompt de 2.1 millones de tokens a través de las 78 capas de GLM-5.2. Estos experimentos establecen la capacidad de ejecución, más que la corrección completa del entrenamiento, ya que el estado capturado del prompt está separado y algunas rutas de composición de gradientes y forward distribuidas permanecen incompletas.
English
A growing gap separates inference context lengths from RL post-training: inference systems are approaching million-token contexts, while post-training workloads often remain at 256K tokens or below and rely on length generalization at deployment. The gap is especially important for AI agents, whose observations, tool outputs, documents, and prior decisions accumulate over long trajectories. LongStraw is an architecture-aware execution stack for million-token RL post-training under a fixed GPU budget, instantiated with Group Relative Policy Optimization (GRPO). It evaluates the shared prompt without autograd, retains only model-specific state needed by later tokens, and replays short response branches one at a time, reducing the live training graph at the cost of additional replay time. We implement it for the hybrid recurrent and full-attention Qwen3.6-27B and the compressed-attention mixture-of-experts GLM-5.2. On eight H20 GPUs, LongStraw completes grouped Qwen scoring and response backward at 2.1M positions for groups of 2 and 8; increasing the group size adds only 0.21 GB of peak allocated memory, while a separate stress test reaches 4.46M positions. On 32 H20 GPUs, we validate the end-to-end LongStraw execution path for a 2.1M-token prompt across all 78 layers of GLM-5.2. These experiments establish execution capacity rather than complete training correctness because the captured prompt state is detached and some distributed forward and gradient composition paths remain incomplete.
PDF402July 18, 2026