ChatPaper.aiChatPaper

SWE-Bench Pro Verified: 소프트웨어 엔지니어링 에이전트를 위한 신뢰할 수 있는 벤치마크

SWE-Bench Pro Verified: A Reliable Benchmark for Software Engineering Agents

September 8, 2026
저자: Pujun Zheng, Zixin Shang, Shufan Jiang, Wenhui Tian, Dongsheng Zhu, Zerun Ma, Dingbo Yuan, Qi Zhang
cs.AI

초록

SWE-Bench Pro는 어려운 저장소 수준 과제에서 소프트웨어 엔지니어링 에이전트를 평가하기 위한 표준 벤치마크로 자리 잡았다. 그러나 우리의 분석 작업은 그 평가가 두 가지 불신뢰성 원인에 의해 훼손된다는 점을 보여준다. 하나는 정답 해 또는 숨겨진 평가 정보의 유출로 가능해진 보상 해킹이고, 다른 하나는 오해를 유발하는 문제 설명과 부적절하게 범위가 설정된 테스트를 포함한 과제 품질 문제이다. 이러한 문제들은 벤치마크 성능을 부풀리고 에이전트의 진정한 코딩 능력을 가릴 수 있다. 우리는 두 문제를 모두 해결한 SWE-Bench Pro의 검증된 버전인 SWE-Bench Pro Verified를 제시한다. 우리의 접근법은 정상적인 에이전트 기능을 방해하지 않으면서 주요 유출 경로를 제거하는 해킹 방지 안전장치와, 결함 있는 인스턴스 내의 불일치를 최소한으로 수정하는 과제 정교화를 결합한다. SWE-Bench Pro Verified에 대한 평가는 일부 모델이 이전에 보고된 것보다 상당히 저조한 성능을 보인다는 점을 드러내며, 이는 SWE-Bench Pro에 대한 기존 결과가 실제 소프트웨어 엔지니어링 역량을 과대평가했을 수 있음을 시사한다. SWE-Bench Pro Verified는 소프트웨어 엔지니어링 에이전트를 평가하기 위한 더 신뢰할 수 있는 벤치마크를 제공한다.
English
SWE-Bench Pro has emerged as a standard benchmark for evaluating software engineering agents on challenging repository-level tasks. However, our analysis work show that its evaluation is undermined by two sources of unreliability: reward hacking, enabled by leakage of gold solutions or hidden evaluation information, and task quality issues, including misleading problem statements and improperly scoped tests. These issues can inflate benchmark performance and obscure agents' true coding ability. We present SWE-Bench Pro Verified, a verified version of SWE-Bench Pro that addresses both problems. Our approach combines anti-hacking safeguards that eliminate major leakage channels without disrupting normal agent functionality, with task refinement that minimally corrects inconsistencies within flawed instances. Evaluations on SWE-Bench Pro Verified reveal that some models perform substantially worse than previously reported, suggesting that existing results on SWE-Bench Pro may overestimate real software engineering capability. SWE-Bench Pro Verified offers a more trustworthy benchmark for assessing software engineering agents.