SWE-Together: Evaluatie van codeeragenten in interactieve gebruikerssessies
SWE-Together: Evaluating Coding Agents in Interactive User Sessions
June 29, 2026
Auteurs: Yifan Wu, Zhuokai Zhao, Songlin Li, Ho Hin Lee, Jiacheng Zhu, Shirley Wu, Tianhe Yu, Serena Li, Lizhu Zhang, Xiangjun Fan, Shengzhi Li
cs.AI
Samenvatting
De meeste benchmarks voor codeeragenten zijn statisch: een agent krijgt vooraf een volledige taakomschrijving en wordt alleen beoordeeld op de uiteindelijke code. In de praktijk is codeerondersteuning echter interactief, waarbij gebruikers doelen verduidelijken, beperkingen toevoegen en fouten corrigeren gedurende meerdere gespreksronden. We introduceren SWE-Together, een multi-turn benchmark die is samengesteld uit echte codeersessies tussen gebruikers en agenten. Om echte interacties verifieerbaar te maken, hebben we 109 repository-niveau taken geselecteerd uit 11.260 geregistreerde sessies, waarbij we sessies kozen met herstelbare repository-toestanden, duidelijke gebruikersdoelen en waarneembare uitkomsten. Om deze interacties opnieuw te kunnen afspelen met verschillende agenten, bouwen we een reactieve LLM-gebaseerde gebruikerssimulator die de oorspronkelijke gebruikersintenties behoudt en feedback geeft wanneer de codeeragent voortgang vereist. Om agenten als samenwerkingspartners te evalueren, meten we zowel de uiteindelijke correctheid van de repository als het aantal corrigerende feedbackronden tijdens de interactie. Experimenten met geavanceerde codeeragenten tonen aan dat sterkere agenten over het algemeen hogere uiteindelijke slagingspercentages behalen, terwijl ze minder interventies nodig hebben, wat wijst op een verbeterde gebruikerservaring.
English
Most coding-agent benchmarks are static: an agent receives a complete task description up front and is judged only by its final code. Real coding assistance is interactive, with users clarifying goals, adding constraints, and correcting mistakes over multiple turns. We introduce SWE-Together, a multi-turn benchmark reconstructed from real user-agent coding sessions. To make real interactions verifiable, we curate 109 repository-level tasks from 11,260 recorded sessions, selecting sessions with recoverable repository states, clear user goals, and observable outcomes. To replay these interactions across agents, we build a reactive LLM-based user simulator that preserves the original users' intents and provides feedback when the coding agent's progress requires it. To evaluate agents as collaborators, we measure both final repository correctness and the number of corrective feedback turns required during the interaction. Experiments with frontier coding agents show that stronger agents generally achieve higher final success rates while requiring fewer interventions, suggesting an improved user experience.