Évaluation Efficace des Agents par Simulation d'Utilisateurs Guidée par la Diversité
Efficient Agent Evaluation via Diversity-Guided User Simulation
April 23, 2026
Auteurs: Itay Nakash, George Kour, Ateret Anaby-Tavor
cs.AI
Résumé
Les grands modèles de langage (LLM) sont de plus en plus déployés en tant qu'agents interactifs pour les clients, mais l'évaluation de leur fiabilité reste difficile en raison d'interactions stochastiques et multi-tours. Les protocoles d'évaluation actuels reposent sur des déroulements linéaires de Monte Carlo de conversations complètes agent-utilisateur pour estimer la réussite. Cependant, cette approche est informatiquement inefficace, régénérant à répétition des préfixes initiaux identiques, et échoue souvent à détecter des modes d'échec profonds résultant de comportements utilisateurs rares.
Nous présentons DIVERT (Évaluation par Induction de Diversité via Branchement de Trajectoires), un cadre de simulation utilisateur efficace, basé sur des instantanés et guidé par la couverture, pour l'exploration systématique des interactions agent-utilisateur. DIVERT capture l'état complet agent-environnement aux points de décision critiques et reprend l'exécution à partir de ces instantanés, permettant la réutilisation des préfixes de conversation partagés et réduisant les calculs redondants. À partir de chaque jonction, le framework opère un branchement en utilisant des réponses utilisateur ciblées, induisant la diversité, permettant ainsi une exploration dirigée des chemins d'interaction alternatifs.
En concentrant l'évaluation sur des trajectoires sémantiquement diversifiées et sous-explorées, DIVERT améliore à la fois l'efficacité et la couverture. Les résultats empiriques montrent qu'il découvre plus de défaillances par token comparé aux protocoles de déroulement linéaire standards, tout en élargissant l'ensemble des tâches pour lesquelles des échecs sont identifiés.
English
Large language models (LLMs) are increasingly deployed as customer-facing agents, yet evaluating their reliability remains challenging due to stochastic, multi-turn interactions. Current evaluation protocols rely on linear Monte Carlo rollouts of complete agent-user conversations to estimate success. However, this approach is computationally inefficient, repeatedly regenerating identical early prefixes, and often fails to uncover deep failure modes that arise from rare user behaviors.
We introduce DIVERT (Diversity-Induced Evaluation via Branching of Trajectories), an efficient, snapshot-based, coverage-guided user simulation framework for systematic exploration of agent-user interactions. DIVERT captures the full agent-environment state at critical decision points and resumes execution from these snapshots, enabling reuse of shared conversation prefixes and reducing redundant computation. From each junction, the framework branches using targeted, diversity-inducing user responses, allowing directed exploration of alternative interaction paths.
By focusing evaluation on semantically diverse and underexplored trajectories, DIVERT improves both efficiency and coverage. Empirical results show that it discovers more failures per token compared to standard linear rollout protocols, while expanding the set of tasks on which failures are identified.