PACE: Um Proxy para a Avaliação de Capacidade Agentiva
PACE: A Proxy for Agentic Capability Evaluation
July 2, 2026
Autores: Yueqi Song, Lintang Sutawika, Jiarui Liu, Lindia Tjuatja, Jiayi Geng, Yunze Xiao, Daniel Lee, Aditya Bharat Soni, Vincent Lo, Xiang Yue, Graham Neubig
cs.AI
Resumo
Avaliar agentes LLM em benchmarks como SWE-Bench e GAIA pode ser caro, demorado e exigir infraestrutura complexa. Uma única avaliação pode custar milhares de dólares e levar dias para ser concluída. Em contraste, benchmarks LLM não agentivos que testam capacidades individuais (por exemplo, raciocínio, geração de código) são rápidos e baratos de executar. Neste artigo, investigamos se o desempenho em benchmarks agentivos caros pode ser previsto com precisão a partir do desempenho em um pequeno subconjunto cuidadosamente selecionado de instâncias de avaliação atômica. Apresentamos o PACE, uma estrutura que constrói benchmarks proxy selecionando instâncias de avaliações não agentivas existentes cujas pontuações agregadas preveem de forma mais confiável os desempenhos dos modelos em benchmarks agentivos. Dado um conjunto de instâncias candidatas abrangendo capacidades atômicas, o PACE ajusta uma regressão que mapeia as pontuações de um modelo em um subconjunto compacto de instâncias fonte para sua pontuação no benchmark agentivo alvo. O subconjunto em si é curado combinando duas estratégias complementares de seleção de instâncias: seleção local por relevância ao alvo e seleção global informativa. Aplicamos o PACE aos 4 benchmarks agentivos alvo neste artigo, o que resulta no PACE-Bench, o benchmark proxy concreto que avaliamos no artigo. Experimentos em 14 modelos, 4 benchmarks agentivos e 19 benchmarks não agentivos mostram que o PACE-Bench prevê pontuações agentivas com erro absoluto médio (EAM) de validação cruzada deixando um de fora (LOOCV) abaixo de 4%, correlação de Spearman acima de 0,80 e precisão de ranqueamento pareado de modelos em torno de 85%, tudo isso a menos de 1% do custo total da avaliação agentiva. Analisamos ainda as instâncias proxy selecionadas, revelando quais habilidades cada benchmark agentivo exige de forma única. O PACE permite que profissionais obtenham estimativas confiáveis de desempenho agentivo durante o desenvolvimento, seleção e roteamento de modelos, sem a sobrecarga da avaliação completa do agente.
English
Evaluating LLM agents on benchmarks like SWE-Bench and GAIA can be expensive, time-consuming, and requires complex infrastructure. A single evaluation can cost thousands of dollars and take days to complete. In contrast, non-agentic LLM benchmarks that test individual capabilities (e.g., reasoning, code generation) are fast and cheap to run. In this paper, we investigate whether performance on expensive agentic benchmarks can be accurately predicted by the performance on a small, carefully selected subset of atomic evaluation instances. We introduce PACE, a framework that constructs proxy benchmarks by selecting instances from existing non-agentic evaluations whose aggregate scores most reliably predict model performances on agentic benchmarks. Given a pool of candidate instances spanning atomic capabilities, PACE fits a regression that maps a model's scores on a compact subset of source instances to its score on the target agentic benchmark. The subset itself is curated by combining two complementary instance-selection strategies, target-relevance local selection and globally informative global selection. We apply PACE to the 4 target agentic benchmarks in this paper, which yields PACE-Bench, the concrete proxy benchmark that we evaluate in the paper. Experiments across 14 models, 4 agentic benchmarks, and 19 non-agentic benchmarks show that PACE-Bench predicts agentic scores with leave-one-out cross-validation (LOOCV) mean absolute error (MAE) under 4%, Spearman correlation above 0.80, and pairwise model-ranking accuracy around 85%, all at much less than 1% of the full agentic evaluation cost. We further analyze the selected proxy instances, revealing which skills each agentic benchmark uniquely demands. PACE enables practitioners to obtain reliable estimates of agentic performance during model development, selection, and routing, without the overhead of full agent evaluation.