Passando pelo Crivo: Reavaliando as Capacidades de Agentes Além de Ambientes Familiares
Running the Gauntlet: Re-evaluating the Capabilities of Agents Beyond Familiar Environments
June 25, 2026
Autores: Mykola Vysotskyi, Runqi Lin, Grzegorz Biziel, Michal Zakrzewski, Sebastian Montagna, Damian Rynczak, Shreyansh Padarha, Kumail Alhamoud, Zihao Fu, William Lugoloobi, Kai Rawal, Hanna Yershova, Xander Davies, Taras Rumezhak, Guohao Li, Fazl Barez, Baoyuan Wu, Arkadiusz Drohomirecki, Yarin Gal, Chris Russell, Christopher Summerfield, Adam Mahdi, Volodymyr Karpiv, Philip Torr, Adel Bibi
cs.AI
Resumo
À medida que os sistemas agentivos continuam a evoluir e são amplamente implantados em cenários do mundo real, há uma demanda crescente por avaliar fielmente suas capacidades. No entanto, os benchmarks atuais são tipicamente construídos sobre aplicações populares com tarefas relativamente simples e focam em um conjunto restrito de capacidades, negligenciando dimensões mais amplas, resultando em desempenho saturado em agentes modernos e falhando em sondar suas limitações. Para tal, apresentamos o GauntletBench, um benchmark baseado na web para avaliar a generalização de agentes em cenários desafiadores, com foco em três capacidades pouco exploradas (percepção temporal, compreensão gráfica e raciocínio 3D), em cinco aplicações profissionais menos abordadas (Editor de Vídeo, Construtor de Fluxos de Trabalho, Modelador 3D, Analisador de Voos e Projetista de Circuitos), cada uma com 20 tarefas com uso intensivo de visão (100 no total). Nosso benchmark fornece um pipeline modular que compreende um ambiente compatível tanto com frameworks de agentes de código aberto quanto fechado, uma aplicação web controlada, um conjunto de tarefas bem estruturado e um mecanismo de avaliação automatizado com métricas diversificadas. Contrariando expectativas generalizadas, nossos resultados empíricos revelam que os sistemas agentivos de ponta ainda estão longe de alcançar desempenho em nível humano. Mesmo o agente estado-da-arte alcança apenas uma taxa de sucesso de 19,1% em nosso GauntletBench, destacando as limitações nessas capacidades negligenciadas e na generalização. Em comparação, anotadores humanos não especialistas alcançam mais de 80% de sucesso em nossas tarefas desafiadoras, porém factíveis, revelando a lacuna substancial entre as capacidades atuais dos agentes e aquelas necessárias para cenários complexos do mundo real.
English
As agentic systems continue to evolve and are widely deployed in real-world scenarios, there is a growing demand to faithfully evaluate their capabilities. However, current benchmarks are typically built on popular applications with relatively simple tasks and focus on a narrow set of capabilities while overlooking broader dimensions, resulting in saturated performance on modern agents and failing to probe their limitations. To this end, we introduce GauntletBench, a web-based benchmark for evaluating agent generalisation in challenging scenarios, focusing on three underexplored capabilities (temporal perception, graphical understanding, and 3D reasoning), across five less-covered professional applications (Video Editor, Workflow Builder, 3D Modeller, Flight Analyser, and Circuit Designer), each with 20 vision-intensive tasks (100 in total). Our benchmark provides a modular pipeline that comprises an environment compatible with both open- and closed-source agent frameworks, a controlled web-based application, a well-structured task suite, and an automated evaluation engine with diverse metrics. Contrary to widespread expectations, our empirical results reveal that frontier agentic systems remain far from achieving human-level performance. Even the state-of-the-art agent achieves only a 19.1% success rate on our GauntletBench, highlighting the limitations in these overlooked capabilities and generalisation. By comparison, non-expert human annotators achieve over 80% success on our challenging yet feasible tasks, revealing the substantial gap between current agent capabilities and those required for complex real-world scenarios.