LongStraw: Lange-context RL voorbij 2 miljoen tokens onder een vast GPU-budget

LongStraw: Long-Context RL Beyond 2M Tokens under a Fixed GPU Budget

July 16, 2026
Auteurs: Changhai Zhou, Kieran Liu, Yuhua Zhou, Qian Qiao, Jun Gao, Harry Zhang, Irvine Lu, Nolan Ho, Lucian Li, Andrew Lei, Cleon Cheng, Steven Chiang, Yihang Zeng, Di Zhang, Rio Yang, Kaijie Chen, Andrew Chen, Pony Ma, Weizhong Zhang, Cheng Jin
cs.AI

Samenvatting

Een groeiende kloof scheidt inferentiecontextlengtes van RL-natraining: inferentiesystemen naderen contexten van een miljoen tokens, terwijl natrainingsworkloads vaak blijven steken op 256K tokens of minder en vertrouwen op lengtegeneralisatie tijdens implementatie. De kloof is vooral belangrijk voor AI-agenten, waarvan de waarnemingen, tooluitvoer, documenten en eerdere beslissingen zich ophopen over lange trajecten. LongStraw is een architectuurbewuste uitvoeringsstack voor RL-natraining met een miljoen tokens onder een vast GPU-budget, geïmplementeerd met Group Relative Policy Optimization (GRPO). Het evalueert de gedeelde prompt zonder autograd, behoudt alleen modelspecifieke status die later nodig is voor tokens, en speelt korte responsvertakkingen één voor één af, waardoor de actieve trainingsgrafiek wordt verkleind ten koste van extra afspeeltijd. We implementeren het voor de hybride recurrente en volledige-aandacht Qwen3.6-27B en de gecomprimeerde-aandacht mixture-of-experts GLM-5.2. Op acht H20-GPU's voltooit LongStraw gegroepeerde Qwen-scoring en response backward op 2,1M posities voor groepen van 2 en 8; het vergroten van de groepsgrootte voegt slechts 0,21 GB aan piekgeheugengebruik toe, terwijl een aparte stresstest 4,46M posities bereikt. Op 32 H20-GPU's valideren we het end-to-end-uitvoeringspad van LongStraw voor een prompt van 2,1M tokens over alle 78 lagen van GLM-5.2. Deze experimenten leggen uitvoeringscapaciteit vast, niet volledige trainingscorrectheid, omdat de vastgelegde promptstatus is losgekoppeld en sommige gedistribueerde forward- en gradientcompositiepaden onvolledig blijven.
English
A growing gap separates inference context lengths from RL post-training: inference systems are approaching million-token contexts, while post-training workloads often remain at 256K tokens or below and rely on length generalization at deployment. The gap is especially important for AI agents, whose observations, tool outputs, documents, and prior decisions accumulate over long trajectories. LongStraw is an architecture-aware execution stack for million-token RL post-training under a fixed GPU budget, instantiated with Group Relative Policy Optimization (GRPO). It evaluates the shared prompt without autograd, retains only model-specific state needed by later tokens, and replays short response branches one at a time, reducing the live training graph at the cost of additional replay time. We implement it for the hybrid recurrent and full-attention Qwen3.6-27B and the compressed-attention mixture-of-experts GLM-5.2. On eight H20 GPUs, LongStraw completes grouped Qwen scoring and response backward at 2.1M positions for groups of 2 and 8; increasing the group size adds only 0.21 GB of peak allocated memory, while a separate stress test reaches 4.46M positions. On 32 H20 GPUs, we validate the end-to-end LongStraw execution path for a 2.1M-token prompt across all 78 layers of GLM-5.2. These experiments establish execution capacity rather than complete training correctness because the captured prompt state is detached and some distributed forward and gradient composition paths remain incomplete.
PDF402July 18, 2026