SWE-Review: Het sluiten van de cyclus van issue-oplossing met agentische code review.
SWE-Review: Closing the Loop on Issue Resolution with Agentic Code Review
July 7, 2026
Auteurs: Ruoyu Wang, Jierun Chen, Shaowei Wang, Chaofan Tao, Sidi Yang, Yuxin Jiang, Kim-Hui Yap, Lifeng Shang, Xiaohui Li, Haoli Bai
cs.AI
Samenvatting
Codeeragenten genereren steeds vaker pull-aanvragen (PR's) voor realistische softwareproblemen, maar eenmalige PR-generatie blijft een open-lus: de PR wordt voorgesteld zonder systematische beoordeling, diagnose of herziening. Wij introduceren SWE-Review, een raamwerk om deze lus te sluiten met agentische codereview. Gegeven een issue en een AI-gegenereerde PR verkent een revieweragent de repository, beslist of de PR moet worden geaccepteerd, en biedt gestructureerde feedback voor revisie. We evalueren deze setting met onze voorgestelde SWE-Review-Bench om zowel de juistheid van de beoordeling als de bruikbaarheid van stroomafwaartse revisie te meten. Verder stellen we de SWE-Review-Traj-dataset samen om bredere toepassingen van agentische review te bestuderen en het gebrek aan gegevens voor open reviewertraining op te vullen. Experimenten tonen aan dat agentische review PR's continu verbetert via een genereer-beoordeel-reviseer-lus, beter presteert dan een eenmalige beoordeling met vaste context in zowel beslissingsnauwkeurigheid als oplossingssnelheid na revisie, zich uitstrekt tot verbetering van issue-oplossingsmodellen, en effectieve en efficiënte testtijdschaling mogelijk maakt. Deze resultaten positioneren agentische codereview als een praktisch mechanisme om AI-codeeragenten van eenmalige PR-generatie naar gesloten-lus issue-oplossing te verplaatsen.
English
Coding agents increasingly generate pull requests (PRs) for real-world software issues, yet one-shot PR generation remains open-loop: the PR is proposed without systematic review, diagnosis, or revision. We introduce SWE-Review, a framework for closing this loop with agentic code review. Given an issue and an AI-generated PR, a reviewer agent explores the repository, decides whether the PR should be accepted, and provides structured feedback for revision. We evaluate this setting with our proposed SWE-Review-Bench to measure both review correctness and downstream revision usefulness. We further curate SWE-Review-Traj dataset to study broader applications of agentic review and fill the data-scarcity gap for open reviewer training. Experiments show that agentic review continuously improves PRs through a generate-review-revise loop, outperforms single-turn fixed-context review in both decision accuracy and resolve rate after revision, transfers beyond review to improve issue-resolution models, and enables effective and efficient test-time scaling. These results position agentic code review as a practical mechanism for moving AI coding agents from one-shot PR generation toward closed-loop issue resolution.