ChatPaper.aiChatPaper

Geração, Filtragem, Controle, Replay: Um Estudo Abrangente sobre Estratégias de Rollout para Aprendizado por Reforço em LLMs

Generate, Filter, Control, Replay: A Comprehensive Survey of Rollout Strategies for LLM Reinforcement Learning

April 8, 2026
Autores: Rohan Surana, Gagan Mundada, Xunyi Jiang, Chuhan Wang, Zhenwei Tang, Difan Jiao, Zihan Huang, Yuxin Xiong, Junda Wu, Sheldon Yu, Xintong Li, Raghav Jain, Nikki Kuang, Sizhe Zhou, Bowen Jin, Zhendong Chu, Tong Yu, Ryan Rossi, Kuan-Hao Huang, Jingbo Shang, Jiawei Han, Julian McAuley
cs.AI

Resumo

O aprendizado por reforço (RL) tornou-se uma ferramenta central de pós-treinamento para melhorar as capacidades de raciocínio de grandes modelos de linguagem (LLMs). Nestes sistemas, o *rollout* – a trajetória amostrada desde um *prompt* até a terminação, incluindo etapas de raciocínio intermediárias e interações opcionais com ferramentas ou ambientes – determina os dados a partir dos quais o otimizador aprende. No entanto, o projeto do *rollout* é frequentemente pouco documentado. Este estudo oferece uma visão independente do otimizador sobre estratégias de *rollout* para o pós-treinamento baseado em RL de LLMs de raciocínio. Formalizamos os *pipelines* de *rollout* com uma notação unificada e introduzimos o *Generate-Filter-Control-Replay* (GFCR), uma taxonomia de ciclo de vida que decompõe os *pipelines* de *rollout* em quatro estágios modulares: **Generate** propõe trajetórias e topologias candidatas; **Filter** constrói sinais intermediários por meio de verificadores, juízes, críticos; **Control** aloca recursos computacionais e toma decisões de continuação/ramificação/parada sob orçamentos; e **Replay** retém e reutiliza artefatos entre *rollouts* sem atualizações de pesos, incluindo currículos de auto-evolução que geram autonomamente novas tarefas de treinamento. Complementamos o GFCR com uma taxonomia de critérios de confiabilidade, cobertura e sensibilidade de custo que caracteriza os trade-offs do *rollout*. Utilizando este framework, sintetizamos métodos que abrangem RL com recompensas verificáveis, supervisão de processo, gateamento baseado em juízes, *rollouts* guiados e em árvore/segmento, alocação adaptativa de computação, *rollouts* com saída antecipada e parciais, otimização de taxa de transferência e *replay*/recomposição para autoaperfeiçoamento. Fundamentamos o framework com estudos de caso em matemática, código/SQL, raciocínio multimodal, agentes que utilizam ferramentas e benchmarks de habilidades agentes que avaliam indução, reuso e transferência de habilidades entre tarefas. Finalmente, fornecemos um índice de diagnóstico que mapeia patologias comuns de *rollout* para os módulos GFCR e alavancas de mitigação, juntamente com desafios em aberto para a construção de *pipelines* de *rollout* reproduzíveis, computacionalmente eficientes e confiáveis.
English
Reinforcement learning (RL) has become a central post-training tool for improving the reasoning abilities of large language models (LLMs). In these systems, the rollout, the trajectory sampled from a prompt to termination, including intermediate reasoning steps and optional tool or environment interactions, determines the data the optimizer learns from, yet rollout design is often underreported. This survey provides an optimizer-agnostic view of rollout strategies for RL-based post-training of reasoning LLMs. We formalize rollout pipelines with unified notation and introduce Generate-Filter-Control-Replay (GFCR), a lifecycle taxonomy that decomposes rollout pipelines into four modular stages: Generate proposes candidate trajectories and topologies; Filter constructs intermediate signals via verifiers, judges, critics; Control allocates compute and makes continuation/branching/stopping decisions under budgets; and Replay retains and reuses artifacts across rollouts without weight updates, including self-evolving curricula that autonomously generate new training tasks. We complement GFCR with a criterion taxonomy of reliability, coverage, and cost sensitivity that characterizes rollout trade-offs. Using this framework, we synthesize methods spanning RL with verifiable rewards, process supervision, judge-based gating, guided and tree/segment rollouts, adaptive compute allocation, early-exit and partial rollouts, throughput optimization, and replay/recomposition for self-improvement. We ground the framework with case studies in math, code/SQL, multimodal reasoning, tool-using agents, and agentic skill benchmarks that evaluate skill induction, reuse, and cross-task transfer. Finally, we provide a diagnostic index that maps common rollout pathologies to GFCR modules and mitigation levers, alongside open challenges for building reproducible, compute-efficient, and trustworthy rollout pipelines.