SEIF : Apprentissage par renforcement auto-évolutif pour le suivi d'instructions
SEIF: Self-Evolving Reinforcement Learning for Instruction Following
May 8, 2026
Auteurs: Qingyu Ren, Qianyu He, Jiajie Zhu, Xingzhou Chen, Jingwen Chang, Zeye Sun, Han Xia, Fei Yu, Jiaqing Liang, Yanghua Xiao
cs.AI
Résumé
La capacité à suivre des instructions est une compétence fondamentale des grands modèles de langage (LLMs), mais son amélioration continue reste un défi. Les méthodes existantes reposent généralement soit sur une supervision externe coûteuse, provenant d'humains ou de modèles enseignants performants, soit sur un apprentissage par auto-jeu avec des instructions de difficulté statique, incapables d'évoluer parallèlement aux capacités du modèle. Pour pallier ces limitations, nous proposons SEIF (Self-Evolving Reinforcement Learning for Instruction Following), un cadre d'auto-évolution visant à renforcer la capacité des LLMs à suivre des instructions. SEIF forme une boucle d'auto-évolution fermée où l'amélioration de la capacité à suivre des instructions et l'évolution de la difficulté des instructions se renforcent mutuellement. SEIF comprend quatre rôles : un Instructeur qui génère des instructions de difficulté croissante, un Filtre qui élimine les instructions conflictuelles ou invalides pour garantir la qualité des données, un Suiveur qui apprend à suivre les instructions évoluées, et un Juge qui fournit des signaux de récompense pour l'apprentissage par renforcement. L'Instructeur et le Suiveur sont entraînés en alternance et co-évoluent tout au long du processus. Des expériences menées à plusieurs échelles de modèles et architectures montrent que SEIF améliore systématiquement les performances en matière de suivi d'instructions, ce qui suggère une forte généralité. Des analyses plus approfondies révèlent les sources d'amélioration et identifient une stratégie d'entraînement efficace pour l'auto-évolution sur des tâches ouvertes : un entraînement suffisant en phase précoce pour établir une base solide, suivi d'un entraînement modéré en phase tardive pour atténuer le sur-apprentissage et obtenir de meilleures performances finales. Le code et les données sont disponibles publiquement à l'adresse https://github.com/Rainier-rq1/SEIF.
English
Instruction following is a fundamental capability of large language models (LLMs), yet continuously improving this capability remains challenging. Existing methods typically rely either on costly external supervision from humans or strong teacher models, or on self-play training with static-difficulty instructions that cannot evolve as the model's capabilities improve. To address these limitations, we propose SEIF (Self-Evolving Reinforcement Learning for Instruction Following), a self-evolving framework for enhancing the instruction-following ability of LLMs. SEIF forms a closed self-evolution loop that improves the model's instruction-following ability, where instruction difficulty evolution and model capability evolution reinforce each other. SEIF consists of four roles: an Instructor that generates increasingly challenging instructions, a Filter that removes conflicting or invalid instructions to ensure data quality, a Follower that learns to follow evolved instructions, and a Judger that provides reward signals for reinforcement learning. The Instructor and Follower are alternately trained and co-evolve throughout the process. Experiments across multiple model scales and architectures show that SEIF consistently improves instruction-following performance, suggesting strong generality. Further analyses reveal the sources of improvement and identify an effective training strategy for self-evolution on open-ended tasks: sufficient early-stage training to build a solid foundation, followed by moderate late-stage training to mitigate overfitting and achieve better final performance. The code and data are publicly available at https://github.com/Rainier-rq1/SEIF.