EvoPolicyGym: Evaluatie van autonome beleidsevolutie in interactieve omgevingen
EvoPolicyGym: Evaluating Autonomous Policy Evolution in Interactive Environments
July 2, 2026
Auteurs: Zhilin Wang, Han Song, Runzhe Zhan, Jusen Du, Jiacheng Chen, Tianle Li, Qingyu Yin, Yulun Wu, Zhennan Shen, Tong Zhu, Yanshu Li, Guanjie Chen, Derek F. Wong, Yafu Li, Yu Cheng, Yang Yang
cs.AI
Samenvatting
Autonome agenten worden steeds vaker geacht uitvoerbare beleidslijnen te verbeteren via feedback, maar bestaande evaluaties reduceren dit proces vaak tot een eindscore of verwarren het met open-ended vooruitgang in software-engineering. Wij introduceren Autonome Beleidsevolutie, een gecontroleerde evaluatieomgeving waarin een harness-modelagent herhaaldelijk een uitvoerbaar beleidssysteem bewerkt binnen een vast interactiebudget. Deze omgeving concretiseren wij in EvoPolicyGym, een benchmark die is opgebouwd uit compacte interactieve RL-omgevingen en evalueert hoe agenten verkende beleidslijnen iteratief verbeteren. Op de EvoPolicyGym-suite behaalt GPT-5.5 de sterkste totale rangscore en prestaties in de top twee op alle 16 omgevingen. Naast ranglijstresultaten biedt EvoPolicyGym ook trajectniveau-diagnostiek die inzichtelijk maakt hoe agenten budget toewijzen en feedback omzetten in parametrische afstemming. Deze analyses tonen aan dat sterke autonome beleidsevolutie niet alleen afhangt van geïsoleerde taakoverwinningen, maar van het ontdekken van taakgeschikte mechanismen en het verfijnen van beleid binnen begrensde feedback.
English
Autonomous agents are increasingly expected to improve executable policies through feedback, yet existing evaluations often collapse this process into a final score or confound it with open-ended software-engineering progress. We introduce Autonomous Policy Evolution, a controlled evaluation setting in which a harness-model agent repeatedly edits an executable policy system under a fixed interaction budget. We instantiate this setting in EvoPolicyGym, a benchmark built from compact interactive RL environments that evaluates how agents iteratively improve explored policies. On the EvoPolicyGym suite, GPT-5.5 achieves the strongest aggregate rank score and top-two performance on all 16 environments. Beyond leaderboard results, EvoPolicyGym also provides trajectory-level diagnostics that distinguish how agents allocate budget, convert feedback into parametric tuning. These analyses show that strong autonomous policy evolution depends not only on isolated task wins, but on discovering task-appropriate mechanisms and refining policies under bounded feedback.