ChatPaper.aiChatPaper

SWE-Review: Fechando o Ciclo na Resolução de Problemas com Revisão de Código Baseada em Agentes

SWE-Review: Closing the Loop on Issue Resolution with Agentic Code Review

July 7, 2026
Autores: Ruoyu Wang, Jierun Chen, Shaowei Wang, Chaofan Tao, Sidi Yang, Yuxin Jiang, Kim-Hui Yap, Lifeng Shang, Xiaohui Li, Haoli Bai
cs.AI

Resumo

Agentes de codificação geram cada vez mais solicitações de pull (PRs) para problemas reais de software, mas a geração de PRs em uma única tentativa permanece em malha aberta: o PR é proposto sem revisão, diagnóstico ou revisão sistemáticos. Apresentamos o SWE-Review, uma estrutura para fechar essa malha com revisão de código agentiva. Dado um problema e um PR gerado por IA, um agente revisor explora o repositório, decide se o PR deve ser aceito e fornece feedback estruturado para revisão. Avaliamos esse cenário com nosso SWE-Review-Bench proposto para medir tanto a correção da revisão quanto a utilidade da revisão subsequente. Além disso, curamos o conjunto de dados SWE-Review-Traj para estudar aplicações mais amplas da revisão agentiva e preencher a lacuna de escassez de dados para o treinamento aberto de revisores. Experimentos mostram que a revisão agentiva melhora continuamente os PRs por meio de um ciclo de gerar-revisar-revisar, supera a revisão de contexto fixo de turno único tanto na precisão da decisão quanto na taxa de resolução após a revisão, transfere-se além da revisão para melhorar modelos de resolução de problemas e possibilita uma escalabilidade eficaz e eficiente no tempo de teste. Esses resultados posicionam a revisão de código agentiva como um mecanismo prático para mover agentes de codificação de IA da geração de PRs em uma única tentativa para a resolução de problemas em malha fechada.
English
Coding agents increasingly generate pull requests (PRs) for real-world software issues, yet one-shot PR generation remains open-loop: the PR is proposed without systematic review, diagnosis, or revision. We introduce SWE-Review, a framework for closing this loop with agentic code review. Given an issue and an AI-generated PR, a reviewer agent explores the repository, decides whether the PR should be accepted, and provides structured feedback for revision. We evaluate this setting with our proposed SWE-Review-Bench to measure both review correctness and downstream revision usefulness. We further curate SWE-Review-Traj dataset to study broader applications of agentic review and fill the data-scarcity gap for open reviewer training. Experiments show that agentic review continuously improves PRs through a generate-review-revise loop, outperforms single-turn fixed-context review in both decision accuracy and resolve rate after revision, transfers beyond review to improve issue-resolution models, and enables effective and efficient test-time scaling. These results position agentic code review as a practical mechanism for moving AI coding agents from one-shot PR generation toward closed-loop issue resolution.