ChatPaper.aiChatPaper

SEIF: Aprendizado por Reforço Auto-Evolutivo para Seguimento de Instruções

SEIF: Self-Evolving Reinforcement Learning for Instruction Following

May 8, 2026
Autores: Qingyu Ren, Qianyu He, Jiajie Zhu, Xingzhou Chen, Jingwen Chang, Zeye Sun, Han Xia, Fei Yu, Jiaqing Liang, Yanghua Xiao
cs.AI

Resumo

A capacidade de seguir instruções é uma característica fundamental dos modelos de linguagem de grande escala (LLMs), mas aprimorá-la continuamente ainda é um desafio. Métodos existentes geralmente dependem de supervisão externa cara, fornecida por humanos ou modelos professores fortes, ou de treinamento por auto-play com instruções de dificuldade estática, que não evoluem conforme as capacidades do modelo melhoram. Para superar essas limitações, propomos o SEIF (Aprendizado por Reforço Auto-Evolutivo para Seguimento de Instruções), uma estrutura auto-evolutiva para melhorar a capacidade de seguir instruções dos LLMs. O SEIF forma um ciclo fechado de auto-evolução que aprimora a habilidade do modelo de seguir instruções, no qual a evolução da dificuldade das instruções e a evolução das capacidades do modelo se reforçam mutuamente. O SEIF é composto por quatro papéis: um Instrutor, que gera instruções cada vez mais desafiadoras; um Filtro, que remove instruções conflitantes ou inválidas para garantir a qualidade dos dados; um Seguidor, que aprende a seguir instruções evoluídas; e um Avaliador, que fornece sinais de recompensa para o aprendizado por reforço. O Instrutor e o Seguidor são treinados alternadamente e coevoluem ao longo do processo. Experimentos em múltiplas escalas de modelo e arquiteturas mostram que o SEIF melhora consistentemente o desempenho em seguir instruções, sugerindo forte generalidade. Análises adicionais revelam as fontes de melhoria e identificam uma estratégia eficaz de treinamento para auto-evolução em tarefas abertas: treinamento inicial suficiente para construir uma base sólida, seguido de treinamento moderado em fases tardias para mitigar o sobreajuste e alcançar melhor desempenho final. O código e os dados estão publicamente disponíveis em https://github.com/Rainier-rq1/SEIF.
English
Instruction following is a fundamental capability of large language models (LLMs), yet continuously improving this capability remains challenging. Existing methods typically rely either on costly external supervision from humans or strong teacher models, or on self-play training with static-difficulty instructions that cannot evolve as the model's capabilities improve. To address these limitations, we propose SEIF (Self-Evolving Reinforcement Learning for Instruction Following), a self-evolving framework for enhancing the instruction-following ability of LLMs. SEIF forms a closed self-evolution loop that improves the model's instruction-following ability, where instruction difficulty evolution and model capability evolution reinforce each other. SEIF consists of four roles: an Instructor that generates increasingly challenging instructions, a Filter that removes conflicting or invalid instructions to ensure data quality, a Follower that learns to follow evolved instructions, and a Judger that provides reward signals for reinforcement learning. The Instructor and Follower are alternately trained and co-evolve throughout the process. Experiments across multiple model scales and architectures show that SEIF consistently improves instruction-following performance, suggesting strong generality. Further analyses reveal the sources of improvement and identify an effective training strategy for self-evolution on open-ended tasks: sufficient early-stage training to build a solid foundation, followed by moderate late-stage training to mitigate overfitting and achieve better final performance. The code and data are publicly available at https://github.com/Rainier-rq1/SEIF.