Agent-ValueBench: Een alomvattende benchmark voor het evalueren van agentwaarden
Agent-ValueBench: A Comprehensive Benchmark for Evaluating Agent Values
May 11, 2026
Auteurs: Haonan Dong, Qiguan Feng, Kehan Jiang, Haoran Ye, Xin Zhang, Guojie Song
cs.AI
Samenvatting
Autonome agenten zijn snel volwassen geworden als taakuitvoerders en worden op grote schaal ingezet via harnassen zoals OpenClaw. Veiligheidszorgen hebben terecht toenemende onderzoeksaandacht getrokken, en daaronder liggen de waarden die het gedrag van agenten stilzwijgend sturen. Bestaande waardenbenchmarks blijven echter beperkt tot LLM's, waardoor de waarden van agenten grotendeels onbekend zijn. Vanuit intuïtieve, empirische en theoretische invalshoeken tonen we aan dat de waarden van een agent afwijken van die van de onderliggende LLM, en dat de agentische modaliteit bovendien uitdagingen op het niveau van datasets, evaluatie en systeem met zich meebrengt die ontbreken in tekst-only protocollen. We overbruggen deze kloof met Agent-ValueBench, de eerste benchmark die specifiek gericht is op agentwaarden. Deze bevat 394 uitvoerbare omgevingen in 16 domeinen, biedt 4.335 waardeconflicttaken die 28 waardesystemen en 332 dimensies bestrijken. Elk exemplaar is mede gesynthetiseerd via onze speciaal ontwikkelde end-to-end-pijplijn en per exemplaar samengesteld door professionele psychologen. Elke taak wordt geleverd met twee pool-uitgelijnde gouden trajecten waarvan de ijkpunten een op trajectniveau rubric-gebaseerde beoordelaar verankeren. Door 14 grensverleggende propriëtaire en open-gewichtsmodellen te benchmarken in 4 gangbare harnassen, ontdekken we drie samenhangende bevindingen. Agentwaarden manifesteren zich allereerst als een Value Tide van cross-model homogeniteit onder interpreteerbare tegenstromen. Dit getij buigt niet-additief onder de trekkracht van het harnas, en nog beslissender onder bewuste sturing via ingebedde vaardigheden. Samen wijzen deze resultaten erop dat de hefboom voor agent-alignment verschuift van klassieke modelalignment en prompt-sturing naar harnasalignment en vaardigheidssturing.
English
Autonomous agents have rapidly matured as task executors and seen widespread deployment via harnesses such as OpenClaw. Safety concerns have rightly drawn growing research attention, and beneath them lie the values silently steering agent behavior. Existing value benchmarks, however, remain confined to LLMs, leaving agent values largely uncharted. From intuitive, empirical, and theoretical vantage points, we show that an agent's values diverge from those of its underlying LLM, and the agentic modality further introduces dataset-, evaluation-, and system-level challenges absent from text-only protocols. We close this gap with Agent-ValueBench, the first benchmark dedicated to agent values. It features 394 executable environments across 16 domains, offering 4,335 value-conflict tasks that cover 28 value systems and 332 dimensions. Every instance is co-synthesized through our purpose-built end-to-end pipeline and curated per-instance by professional psychologists. Each task ships with two pole-aligned golden trajectories whose checkpoints anchor a trajectory-level rubric-based judge. Benchmarking 14 frontier proprietary and open-weights models across 4 mainstream harnesses, we uncover three concerted findings. Agent values first manifest as a Value Tide of cross-model homogeneity beneath interpretable counter-currents. This tide bends non-additively under harness pull, and yet more decisively under deliberate steering via embedded skills. Together these results signal that the agent-alignment lever is shifting from classical model alignment and prompt steering toward harness alignment and skill steering.