SEIF: Zelf-evoluerend bekrachtigingsleren voor instructievolging
SEIF: Self-Evolving Reinforcement Learning for Instruction Following
May 8, 2026
Auteurs: Qingyu Ren, Qianyu He, Jiajie Zhu, Xingzhou Chen, Jingwen Chang, Zeye Sun, Han Xia, Fei Yu, Jiaqing Liang, Yanghua Xiao
cs.AI
Samenvatting
Instructievolging is een fundamentele eigenschap van grote taalmodellen (LLM's), maar het continu verbeteren van deze eigenschap blijft een uitdaging. Bestaande methoden vertrouwen doorgaans op kostbare externe supervisie van mensen of sterke leermodellen, of op zelfspeltraining met instructies van statische moeilijkheidsgraad die niet kunnen evolueren naarmate de modelcapaciteiten verbeteren. Om deze beperkingen aan te pakken, stellen wij SEIF (Self-Evolving Reinforcement Learning for Instruction Following) voor, een zelf-evoluerend raamwerk voor het verbeteren van het instructievolgvermogen van LLM's. SEIF vormt een gesloten zelf-evolutielus die het instructievolgvermogen van het model verbetert, waarbij de evolutie van de instructiemoeilijkheid en de evolutie van de modelcapaciteiten elkaar versterken. SEIF bestaat uit vier rollen: een Instructeur die steeds uitdagendere instructies genereert, een Filter dat tegenstrijdige of ongeldige instructies verwijdert om de datakwaliteit te waarborgen, een Volger die leert om geëvolueerde instructies op te volgen, en een Beoordelaar die beloningssignalen levert voor versterkingsleren. De Instructeur en de Volger worden afwisselend getraind en co-evolueren gedurende het hele proces. Experimenten op meerdere modelschalen en architecturen tonen aan dat SEIF de instructievolgprestaties consistent verbetert, wat wijst op een sterke algemeenheid. Verdere analyses onthullen de bronnen van verbetering en identificeren een effectieve trainingsstrategie voor zelf-evolutie bij open-eindtaken: voldoende vroege training om een solide basis te leggen, gevolgd door matige late training om overfitting te beperken en betere uiteindelijke prestaties te bereiken. De code en gegevens zijn openbaar beschikbaar op https://github.com/Rainier-rq1/SEIF.
English
Instruction following is a fundamental capability of large language models (LLMs), yet continuously improving this capability remains challenging. Existing methods typically rely either on costly external supervision from humans or strong teacher models, or on self-play training with static-difficulty instructions that cannot evolve as the model's capabilities improve. To address these limitations, we propose SEIF (Self-Evolving Reinforcement Learning for Instruction Following), a self-evolving framework for enhancing the instruction-following ability of LLMs. SEIF forms a closed self-evolution loop that improves the model's instruction-following ability, where instruction difficulty evolution and model capability evolution reinforce each other. SEIF consists of four roles: an Instructor that generates increasingly challenging instructions, a Filter that removes conflicting or invalid instructions to ensure data quality, a Follower that learns to follow evolved instructions, and a Judger that provides reward signals for reinforcement learning. The Instructor and Follower are alternately trained and co-evolve throughout the process. Experiments across multiple model scales and architectures show that SEIF consistently improves instruction-following performance, suggesting strong generality. Further analyses reveal the sources of improvement and identify an effective training strategy for self-evolution on open-ended tasks: sufficient early-stage training to build a solid foundation, followed by moderate late-stage training to mitigate overfitting and achieve better final performance. The code and data are publicly available at https://github.com/Rainier-rq1/SEIF.