EVA-Bench : un nouveau cadre de bout en bout pour évaluer les agents vocaux
EVA-Bench: A New End-to-end Framework for Evaluating Voice Agents
May 13, 2026
Auteurs: Tara Bogavelli, Gabrielle Gauthier Melançon, Katrina Stankiewicz, Oluwanifemi Bamgbose, Fanny Riols, Hoang H. Nguyen, Raghav Mehndiratta, Lindsay Devon Brin, Joseph Marinier, Hari Subramani, Anil Madamala, Sridhar Krishna Nemala, Srinivas Sunkara
cs.AI
Résumé
Les agents vocaux, systèmes d'intelligence artificielle qui mènent des conversations parlées pour accomplir des tâches, sont de plus en plus déployés dans les applications d'entreprise. Cependant, aucun banc d'essai existant ne traite conjointement deux défis fondamentaux de l'évaluation : générer des conversations simulées réalistes et mesurer la qualité sur l'ensemble des modes de défaillance spécifiques à la voix. Nous présentons EVA-Bench, un cadre d'évaluation de bout en bout qui répond à ces deux défis. Du côté de la simulation, EVA-Bench orchestre des conversations audio de robot à robot sur des dialogues dynamiques à plusieurs tours, avec une validation automatique de la simulation qui détecte les erreurs du simulateur utilisateur et régénère de manière appropriée les conversations avant la notation. Du côté de la mesure, EVA-Bench introduit deux métriques composites : EVA-A (Accuracy), qui capture l'accomplissement des tâches, la fidélité et la fidélité audio au niveau du signal ; et EVA-X (Experience), qui capture la progression de la conversation, la concision parlée et le timing des tours de parole. Les deux métriques s'appliquent à différentes architectures d'agents, permettant une comparaison directe entre architectures. EVA-Bench comprend 213 scénarios dans trois domaines d'entreprise, une suite de perturbations contrôlées pour la robustesse aux accents et au bruit, ainsi que des mesures pass@1, pass@k, pass^k qui distinguent la performance maximale de la performance fiable. À travers 12 systèmes couvrant les trois architectures, nous constatons : (1) aucun système ne dépasse simultanément 0,5 sur à la fois EVA-A pass@1 et EVA-X pass@1 ; (2) les performances maximale et fiable divergent considérablement (écart médian pass@k - pass^k de 0,44 sur EVA-A) ; et (3) les perturbations d'accent et de bruit révèlent des écarts de robustesse substantiels, avec des effets variant selon les architectures, les systèmes et les métriques (moyenne allant jusqu'à 0,314). Nous publions le cadre complet, la suite d'évaluation et les données du banc d'essai sous une licence open-source.
English
Voice agents, artificial intelligence systems that conduct spoken conversations to complete tasks, are increasingly deployed across enterprise applications. However, no existing benchmark jointly addresses two core evaluation challenges: generating realistic simulated conversations, and measuring quality across the full scope of voice-specific failure modes. We present EVA-Bench, an end-to-end evaluation framework that addresses both. On the simulation side, EVA-Bench orchestrates bot-to-bot audio conversations over dynamic multi-turn dialogues, with automatic simulation validation that detects user simulator error and appropriately regenerates conversations before scoring. On the measurement side, EVA-Bench introduces two composite metrics: EVA-A (Accuracy), capturing task completion, faithfulness, and audio-level speech fidelity; and EVA-X (Experience), capturing conversation progression, spoken conciseness, and turn-taking timing. Both metrics apply to different agent architectures, enabling direct cross-architecture comparison. EVA-Bench includes 213 scenarios across three enterprise domains, a controlled perturbation suite for accent and noise robustness, and pass@1, pass@k, pass^k measurements that distinguish peak from reliable capability. Across 12 systems spanning all three architectures, we find: (1) no system simultaneously exceeds 0.5 on both EVA-A pass@1 and EVA-X pass@1; (2) peak and reliable performance diverge substantially (median pass@k - pass^k gap of 0.44 on EVA-A); and (3) accent and noise perturbations expose substantial robustness gaps, with effects varying across architectures, systems, and metrics (mean up to 0.314). We release the full framework, evaluation suite, and benchmark data under an open-source license.