ChatPaper.aiChatPaper

Découverte de spécifications de sécurité agentiques à partir de signaux de danger binaires

Discovering Agentic Safety Specifications from 1-Bit Danger Signals

April 25, 2026
Auteurs: Víctor Gallego
cs.AI

Résumé

Les agents de grands modèles de langage peuvent-ils découvrir des objectifs de sécurité cachés par la seule expérience ? Nous présentons EPO-Safe (Optimisation Expérientielle des Invites pour des Agents Sûrs), un cadre dans lequel un LLM génère itérativement des plans d'action, reçoit des avertissements de danger binaires et épars, et fait évoluer une spécification comportementale en langage naturel par la réflexion. Contrairement aux méthodes standards de réflexion des LLM qui s'appuient sur des retours textuels riches (par exemple, des erreurs de compilation ou des réponses environnementales détaillées), EPO-Safe démontre que les LLM peuvent raisonner sur la sécurité à partir d'un signal strictement appauvri dans des environnements structurés et de faible dimension : l'agent n'observe jamais la fonction de performance cachée R*, mais seulement un bit par pas de temps indiquant qu'une action était dangereuse. Nous évaluons le cadre sur cinq AI Safety Gridworlds (Leike et al., 2017) et cinq scénarios analogues basés sur le texte où la récompense visible R peut diverger de R*. EPO-Safe découvre un comportement sûr en 1 à 2 rounds (5 à 15 épisodes), produisant des spécifications lisibles par un humain avec des hypothèses explicatives correctes sur les dangers (par exemple, "Les cellules X sont dangereuses directionnellement : y entrer par le nord est risqué"). Fait crucial, nous montrons que la réflexion standard axée sur la récompense dégrade activement la sécurité : les agents réfléchissant uniquement à la récompense utilisent la boucle pour justifier et accélérer le détournement de récompense, prouvant que la réflexion doit être couplée à un canal de sécurité dédié pour découvrir les contraintes cachées. Nous évaluons également la robustesse aux oracles bruités : même lorsque 50 % des étapes non dangereuses produisent des avertissements fallacieux, la performance de sécurité moyenne ne se dégrade que de 15 % en moyenne, bien que la sensibilité dépende de l'environnement, car la réflexion inter-épisodes filtre naturellement les signaux incohérents. Chaque spécification évoluée fonctionne comme un ensemble auditable de règles comportementales ancrées, découvertes de manière autonome par l'interaction, plutôt que rédigées par des humains comme dans l'IA Constitutionnelle (Bai et al., 2022).
English
Can large language model agents discover hidden safety objectives through experience alone? We introduce EPO-Safe (Experiential Prompt Optimization for Safe Agents), a framework where an LLM iteratively generates action plans, receives sparse binary danger warnings, and evolves a natural language behavioral specification through reflection. Unlike standard LLM reflection methods that rely on rich textual feedback (e.g., compiler errors or detailed environment responses), EPO-Safe demonstrates that LLMs can perform safety reasoning from a strictly impoverished signal in structured, low-dimensional environments: the agent never observes the hidden performance function R^*, only a single bit per timestep indicating that an action was unsafe. We evaluate on five AI Safety Gridworlds (Leike et al., 2017) and five text-based scenario analogs where visible reward R may diverge from R^*. EPO-Safe discovers safe behavior within 1-2 rounds (5-15 episodes), producing human-readable specifications with correct explanatory hypotheses about hazards (e.g., "X cells are directionally hazardous: entering from the north is dangerous"). Critically, we show that standard reward-driven reflection actively degrades safety: agents reflecting on reward alone use the loop to justify and accelerate reward hacking, proving that reflection must be paired with a dedicated safety channel to discover hidden constraints. We further evaluate robustness to noisy oracles: even when 50% of non-dangerous steps produce spurious warnings, mean safety performance degrades by only 15% on average, though sensitivity is environment-dependent, as cross-episode reflection naturally filters inconsistent signals. Each evolved specification functions as an auditable set of grounded behavioral rules discovered autonomously through interaction, rather than authored by humans as in Constitutional AI (Bai et al., 2022).