SWE-Together: Avaliando Agentes de Codificação em Sessões de Usuário Interativas
SWE-Together: Evaluating Coding Agents in Interactive User Sessions
June 29, 2026
Autores: Yifan Wu, Zhuokai Zhao, Songlin Li, Ho Hin Lee, Jiacheng Zhu, Shirley Wu, Tianhe Yu, Serena Li, Lizhu Zhang, Xiangjun Fan, Shengzhi Li
cs.AI
Resumo
A maioria dos benchmarks para agentes de codificação é estática: um agente recebe uma descrição completa da tarefa de antemão e é julgado apenas pelo seu código final. A assistência real de codificação é interativa, com usuários esclarecendo objetivos, adicionando restrições e corrigindo erros ao longo de múltiplas interações. Apresentamos o SWE-Together, um benchmark de múltiplas interações reconstruído a partir de sessões reais de codificação entre usuário e agente. Para tornar as interações reais verificáveis, selecionamos 109 tarefas em nível de repositório de 11.260 sessões registradas, escolhendo sessões com estados de repositório recuperáveis, objetivos claros do usuário e resultados observáveis. Para reproduzir essas interações entre agentes, construímos um simulador de usuário reativo baseado em LLM que preserva as intenções dos usuários originais e fornece feedback quando o progresso do agente de codificação o exige. Para avaliar agentes como colaboradores, medimos tanto a correção final do repositório quanto o número de interações de feedback corretivo necessárias durante a interação. Experimentos com agentes de codificação de ponta mostram que agentes mais fortes geralmente alcançam taxas de sucesso final mais altas enquanto exigem menos intervenções, sugerindo uma experiência de usuário aprimorada.
English
Most coding-agent benchmarks are static: an agent receives a complete task description up front and is judged only by its final code. Real coding assistance is interactive, with users clarifying goals, adding constraints, and correcting mistakes over multiple turns. We introduce SWE-Together, a multi-turn benchmark reconstructed from real user-agent coding sessions. To make real interactions verifiable, we curate 109 repository-level tasks from 11,260 recorded sessions, selecting sessions with recoverable repository states, clear user goals, and observable outcomes. To replay these interactions across agents, we build a reactive LLM-based user simulator that preserves the original users' intents and provides feedback when the coding agent's progress requires it. To evaluate agents as collaborators, we measure both final repository correctness and the number of corrective feedback turns required during the interaction. Experiments with frontier coding agents show that stronger agents generally achieve higher final success rates while requiring fewer interventions, suggesting an improved user experience.