ChatPaper.aiChatPaper

SWE-Bench Pro Verified:ソフトウェアエンジニアリングエージェントのための信頼性の高いベンチマーク

SWE-Bench Pro Verified: A Reliable Benchmark for Software Engineering Agents

September 8, 2026
著者: Pujun Zheng, Zixin Shang, Shufan Jiang, Wenhui Tian, Dongsheng Zhu, Zerun Ma, Dingbo Yuan, Qi Zhang
cs.AI

要旨

SWE-Bench Proは、困難なリポジトリレベルのタスクにおいてソフトウェアエンジニアリングエージェントを評価するための標準的ベンチマークとして登場している。しかし、我々の分析により、その評価は、正解ソリューションまたは隠された評価情報の漏洩によって可能となる報酬ハッキングと、誤解を招く問題文やスコープが不適切なテストを含むタスク品質の問題という、2つの信頼性を損なう要因によって損なわれていることが示された。これらの問題は、ベンチマーク性能を不当に高め、エージェントの真のコーディング能力を覆い隠す可能性がある。我々は、両方の問題に対処するSWE-Bench Proの検証済み版であるSWE-Bench Pro Verifiedを提案する。本アプローチは、通常のエージェント機能を損なうことなく主要な漏洩経路を排除するアンチハッキング対策と、欠陥のあるインスタンス内の不整合を最小限に修正するタスク改良を組み合わせる。SWE-Bench Pro Verifiedでの評価により、一部のモデルは以前に報告されたよりも大幅に性能が低いことが明らかになり、SWE-Bench Proにおける既存の結果が実際のソフトウェアエンジニアリング能力を過大評価している可能性が示唆される。SWE-Bench Pro Verifiedは、ソフトウェアエンジニアリングエージェントを評価するための、より信頼できるベンチマークを提供する。
English
SWE-Bench Pro has emerged as a standard benchmark for evaluating software engineering agents on challenging repository-level tasks. However, our analysis work show that its evaluation is undermined by two sources of unreliability: reward hacking, enabled by leakage of gold solutions or hidden evaluation information, and task quality issues, including misleading problem statements and improperly scoped tests. These issues can inflate benchmark performance and obscure agents' true coding ability. We present SWE-Bench Pro Verified, a verified version of SWE-Bench Pro that addresses both problems. Our approach combines anti-hacking safeguards that eliminate major leakage channels without disrupting normal agent functionality, with task refinement that minimally corrects inconsistencies within flawed instances. Evaluations on SWE-Bench Pro Verified reveal that some models perform substantially worse than previously reported, suggesting that existing results on SWE-Bench Pro may overestimate real software engineering capability. SWE-Bench Pro Verified offers a more trustworthy benchmark for assessing software engineering agents.