Revisiter DAgger à l'ère des agents LLM
Revisiting DAgger in the Era of LLM-Agents
May 13, 2026
Auteurs: Changhao Li, Rushi Qiang, Jiawei Huang, Chenxiao Gao, Chao Zhang, Niao He, Bo Dai
cs.AI
Résumé
Les agents LM à long horizon apprennent à partir d'interactions multi-tours, où une seule erreur précoce peut modifier la distribution des états suivants et faire dérailler toute la trajectoire. Les méthodes existantes présentent des lacunes complémentaires : le fine-tuning supervisé fournit un dense guidage de l'enseignant mais souffre d'un décalage de covariables dû à son entraînement sur des trajectoires hors politique de l'enseignant ; tandis que l'apprentissage par renforcement avec récompenses vérifiables évite ce décalage hors politique en apprenant à partir de rouleaux sur politique, mais avec un retour d'information uniquement parcimonieux sur les résultats. Nous abordons ce dilemme en revisitant l'Agrégation de jeux de données (DAgger) pour les agents LM multi-tours : l'algorithme collecte des trajectoires via une interpolation au niveau du tour entre les politiques de l'étudiant et de l'enseignant, puis l'étudiant est entraîné sur ces trajectoires à l'aide des étiquettes supervisées fournies par l'enseignant. En interagissant directement avec les environnements, nous exposons le modèle à des états réalistes susceptibles d'être rencontrés lors du déploiement, atténuant ainsi efficacement le décalage de covariables. De plus, puisque l'étudiant apprend en imitant le comportement de l'enseignant, il reçoit un retour riche durant l'apprentissage. Pour démontrer que DAgger bénéficie du meilleur des deux mondes, nous avons testé l'algorithme pour entraîner un agent en génie logiciel avec des modèles étudiants à l'échelle 4B et 8B. Sur SWE-bench Verified, notre entraînement de style DAgger améliore la baseline post-entraînement la plus forte de +3,9 points à 4B et de +3,6 points à 8B. L'agent 4B résultant atteint 27,3 %, surpassant des systèmes d'agents SWE 8B représentatifs publiés, tandis que l'agent 8B atteint 29,8 %, dépassant SWE-Gym-32B et se situant à moins de 5 points d'agents plus puissants à l'échelle 32B. Conjointement avec des gains constants sur la partition retenue de SWE-Gym, ces résultats suggèrent l'efficacité de DAgger pour les agents LM modernes à long horizon.
English
Long-horizon LM agents learn from multi-turn interaction, where a single early mistake can alter the subsequent state distribution and derail the whole trajectory. Existing recipes fall short in complementary ways: supervised fine-tuning provides dense teacher supervision but suffers from covariate shift because it is trained on off-policy teacher trajectories; while reinforcement learning with verifiable rewards avoids this off-policy mismatch by learning from on-policy rollouts but with only sparse outcome feedback. We address this dilemma by revisiting Dataset Aggregation (DAgger) for multi-turn LM agents: the algorithm collects trajectories through a turn-level interpolation of student and teacher policies, and the student is then trained on these trajectories using supervised labels provided by the teacher. By directly interacting with environments, we expose the model to realistic states likely to be encountered during deployment, thereby effectively mitigating covariate shift. Besides, since the student is learned by mimicking the teacher's behavior, it receives rich feedback during learning. To demonstrate DAgger enjoys the benefits of both worlds, we tested the algorithm to train a software-engineering agent with 4B- and 8B-scale student models. On SWE-bench Verified, our DAgger-style training improves over the strongest post-training baseline by +3.9 points at 4B and +3.6 points at 8B. The resulting 4B agent reaches 27.3%, outperforming representative published 8B SWE-agent systems, while the 8B agent achieves 29.8%, surpassing SWE-Gym-32B and coming within 5 points of stronger 32B-scale agents. Together with consistent gains on the held-out SWE-Gym split, these results suggest the effectiveness of DAgger for modern long-horizon LM agents.