On-Policy Zelf-Evolutie via Faaltrajecten voor Agentische Veiligheidsafstemming
On-Policy Self-Evolution via Failure Trajectories for Agentic Safety Alignment
May 12, 2026
Auteurs: Bo Yin, Qi Li, Xinchao Wang
cs.AI
Samenvatting
Tool-gebruikende LLM-agenten falen via trajecten in plaats van alleen via uiteindelijke antwoorden, omdat ze onveilige tool-aanroepen kunnen uitvoeren, geïnjecteerde instructies kunnen volgen, schadelijke verzoeken kunnen inwilligen, of onschuldige taken overmatig kunnen weigeren, ondanks het produceren van een ogenschijnlijk veilig antwoord. Bestaande veiligheidsaligneringssignalen zijn grotendeels op antwoordniveau of off-policy, en gaan vaak gepaard met een afweging tussen veiligheid en bruikbaarheid: het verbeteren van de agentveiligheid gaat ten koste van een verminderde taakprestatie. Zulke schaarse en enkelvoudige beloningen beperken de bruikbaarheid in de praktijk ernstig. Om deze kloof te overbruggen, stellen wij FATE voor, een on-policy zelf-evoluerend raamwerk dat door verifieerders gescoorde fouten omzet in reparatiesupervisie zonder expertdemonstraties. Voor elke fout stelt hetzelfde beleid reparatiekandidaten voor, die vervolgens opnieuw door verifieerders worden gescoord en gefilterd op beveiliging, bruikbaarheid, overmatige weigeringscontrole en trajectvaliditeit. Deze dichte informatie op trajectniveau wordt vervolgens gebruikt als supervisiesignaal voor agent-zelfevolutie. Tijdens dit proces introduceren we verder Pareto-Front Beleidsoptimalisatie (PFPO), die gesuperviseerde opwarming combineert met Pareto-bewuste beleidsoptimalisatie om de afweging tussen veiligheid en bruikbaarheid te behouden. Experimenten op AgentDojo, AgentHarm en ATBench tonen aan dat FATE de veiligheid verbetert bij verschillende modellen en schalen, terwijl nuttig gedrag behouden blijft. Vergeleken met sterke basislijnen vermindert FATE het aanvalssuccespercentage met 33,5%, schadelijke naleving met 82,6% en verbetert het de externe trajectveiligheidsdiagnose met 6,5%. Deze resultaten suggereren dat mislukte trajecten gestructureerde reparatiesupervisie kunnen bieden voor veiligere zelf-evoluerende agenten.
English
Tool-using LLM agents fail through trajectories rather than only final responses, as they may execute unsafe tool calls, follow injected instructions, comply with harmful requests, or over-refuse benign tasks despite producing a seemingly safe answer. Existing safety-alignment signals are largely response-level or off-policy, and often incur a safety-utility trade-off: improving agent safety comes at the cost of degraded task performance. Such sparse and single-objective rewards severely limit real-world usability. To bridge this gap, we propose FATE, an on-policy self-evolving framework that transforms verifier-scored failures into repair supervision without expert demonstrations. For each failure, the same policy proposes repair candidates, which are then re-scored by verifiers and filtered across security, utility, over-refusal control, and trajectory validity. This dense trajectory-level information is then used as a supervision signal for agent self-evolution. During this process, we further introduce Pareto-Front Policy Optimization (PFPO), combining supervised warmup with Pareto-aware policy optimization to preserve safety-utility trade-offs. Experiments on AgentDojo, AgentHarm, and ATBench show that FATE improves safety across different models and scales while preserving useful behavior. Compared with strong baselines, FATE reduces attack success rate by 33.5%, harmful compliance by 82.6%, and improves external trajectory-safety diagnosis by 6.5%. These results suggest that failed trajectories can provide structured repair supervision for safer self-evolving agents.