ChatPaper.aiChatPaper

SlopCodeBench: Het benchmarken van hoe codeeragenten verslechteren bij langdurige iteratieve taken

SlopCodeBench: Benchmarking How Coding Agents Degrade Over Long-Horizon Iterative Tasks

March 25, 2026
Auteurs: Gabriel Orlanski, Devjeet Roy, Alexander Yun, Changho Shin, Alex Gu, Albert Ge, Dyah Adila, Frederic Sala, Aws Albarghouthi
cs.AI

Samenvatting

Softwareontwikkeling is iteratief, maar agentgestuurde codeerbenchmarks evalueren overweldigend enkelvoudige oplossingen tegen volledige specificaties. Code kan de testsuite doorstaan, maar progressief moeilijker worden uit te breiden. Recente iteratieve benchmarks proberen deze kloof te dichten, maar beperken de ontwerpbeslissingen van de agent te sterk om getrouw te meten hoe codekwaliteit toekomstige uitbreidingen vormgeeft. Wij introduceren SlopCodeBench, een taalagnostische benchmark bestaande uit 20 problemen en 93 checkpoints, waarin agents herhaaldelijk hun eigen eerdere oplossingen uitbreiden onder evoluerende specificaties die architecturale beslissingen forceren zonder de interne structuur voor te schrijven. Wij volgen twee kwaliteitssignalen op trajectniveau: verboseheid, het aandeel overbodige of gedupliceerde code, en structurele erosie, het deel van de complexiteitsmassa geconcentreerd in functies met hoge complexiteit. Geen enkele agent lost welk probleem dan ook end-to-end op over 11 modellen; het hoogste checkpoint-oplossingspercentage is 17,2%. De kwaliteit verslechtert gestaag: erosie stijgt in 80% van de trajecten en verboseheid in 89,8%. Vergeleken met 48 open-source Python-repositories is agentcode 2,2x verbaarser en duidelijk meer geërodeerd. Het volgen van 20 van die repositories in de tijd toont aan dat menselijke code vlak blijft, terwijl agentcode met elke iteratie verslechtert. Een promptinterventiestudie toont aan dat de initiële kwaliteit kan worden verbeterd, maar dat dit de degradatie niet stopt. Deze resultaten tonen aan dat benchmarks gebaseerd op slaagpercentages de uitbreidingsrobuustheid systematisch onderschatten, en dat huidige agents de ontwerpdisciplines missen die iteratieve softwareontwikkeling vereist.
English
Software development is iterative, yet agentic coding benchmarks overwhelmingly evaluate single-shot solutions against complete specifications. Code can pass the test suite but become progressively harder to extend. Recent iterative benchmarks attempt to close this gap, but constrain the agent's design decisions too tightly to faithfully measure how code quality shapes future extensions. We introduce SlopCodeBench, a language-agnostic benchmark comprising 20 problems and 93 checkpoints, in which agents repeatedly extend their own prior solutions under evolving specifications that force architectural decisions without prescribing internal structure. We track two trajectory-level quality signals: verbosity, the fraction of redundant or duplicated code, and structural erosion, the share of complexity mass concentrated in high-complexity functions. No agent solves any problem end-to-end across 11 models; the highest checkpoint solve rate is 17.2%. Quality degrades steadily: erosion rises in 80% of trajectories and verbosity in 89.8%. Against 48 open-source Python repositories, agent code is 2.2x more verbose and markedly more eroded. Tracking 20 of those repositories over time shows that human code stays flat, while agent code deteriorates with each iteration. A prompt-intervention study shows that initial quality can be improved, but it does not halt degradation. These results demonstrate that pass-rate benchmarks systematically undermeasure extension robustness, and that current agents lack the design discipline iterative software development demands.