LongStraw: RL на длинных контекстах за пределами 2 миллионов токенов при фиксированном бюджете GPU
LongStraw: Long-Context RL Beyond 2M Tokens under a Fixed GPU Budget
July 16, 2026
Авторы: Changhai Zhou, Kieran Liu, Yuhua Zhou, Qian Qiao, Jun Gao, Harry Zhang, Irvine Lu, Nolan Ho, Lucian Li, Andrew Lei, Cleon Cheng, Steven Chiang, Yihang Zeng, Di Zhang, Rio Yang, Kaijie Chen, Andrew Chen, Pony Ma, Weizhong Zhang, Cheng Jin
cs.AI
Аннотация
Растущий разрыв отделяет длины контекста инференса от посттренировки с RL: системы инференса приближаются к контекстам в миллион токенов, в то время как нагрузки посттренировки часто остаются на уровне 256K токенов или ниже и полагаются на обобщение по длине при развёртывании. Этот разрыв особенно важен для ИИ-агентов, чьи наблюдения, результаты работы инструментов, документы и предыдущие решения накапливаются в длинных траекториях. LongStraw — это учитывающий архитектуру стек выполнения для миллион-токенной посттренировки с RL при фиксированном бюджете GPU, инстанцированный с помощью Group Relative Policy Optimization (GRPO). Он вычисляет общий промпт без autograd, сохраняет только специфичное для модели состояние, необходимое для последующих токенов, и воспроизводит короткие ветви ответов по одной за раз, уменьшая живой граф обучения ценой дополнительного времени воспроизведения. Мы реализуем его для гибридной рекуррентной и полной внимания модели Qwen3.6-27B и модели GLM-5.2 со сжатым вниманием и смесью экспертов. На восьми GPU H20 LongStraw выполняет групповое оценивание Qwen и обратное распространение ответов на 2,1 миллиона позиций для групп размером 2 и 8; увеличение размера группы добавляет всего 0,21 ГБ пиковой выделенной памяти, в то время как отдельный стресс-тест достигает 4,46 миллиона позиций. На 32 GPU H20 мы валидируем сквозной путь выполнения LongStraw для промпта из 2,1 миллиона токенов через все 78 слоёв GLM-5.2. Эти эксперименты устанавливают ёмкость выполнения, а не полную корректность обучения, поскольку захваченное состояние промпта отсоединено, а некоторые распределённые пути прямого распространения и композиции градиентов остаются неполными.
English
A growing gap separates inference context lengths from RL post-training: inference systems are approaching million-token contexts, while post-training workloads often remain at 256K tokens or below and rely on length generalization at deployment. The gap is especially important for AI agents, whose observations, tool outputs, documents, and prior decisions accumulate over long trajectories. LongStraw is an architecture-aware execution stack for million-token RL post-training under a fixed GPU budget, instantiated with Group Relative Policy Optimization (GRPO). It evaluates the shared prompt without autograd, retains only model-specific state needed by later tokens, and replays short response branches one at a time, reducing the live training graph at the cost of additional replay time. We implement it for the hybrid recurrent and full-attention Qwen3.6-27B and the compressed-attention mixture-of-experts GLM-5.2. On eight H20 GPUs, LongStraw completes grouped Qwen scoring and response backward at 2.1M positions for groups of 2 and 8; increasing the group size adds only 0.21 GB of peak allocated memory, while a separate stress test reaches 4.46M positions. On 32 H20 GPUs, we validate the end-to-end LongStraw execution path for a 2.1M-token prompt across all 78 layers of GLM-5.2. These experiments establish execution capacity rather than complete training correctness because the captured prompt state is detached and some distributed forward and gradient composition paths remain incomplete.