ChatPaper.aiChatPaper

SWE-Review: замыкание цикла решения проблем с помощью агентного код-ревью

SWE-Review: Closing the Loop on Issue Resolution with Agentic Code Review

July 7, 2026
Авторы: Ruoyu Wang, Jierun Chen, Shaowei Wang, Chaofan Tao, Sidi Yang, Yuxin Jiang, Kim-Hui Yap, Lifeng Shang, Xiaohui Li, Haoli Bai
cs.AI

Аннотация

Кодирующие агенты всё чаще генерируют pull request'ы (PR) для решения реальных проблем программного обеспечения, однако однократная генерация PR остаётся разомкнутой: PR предлагается без систематического анализа, диагностики или доработки. Мы представляем SWE-Review — фреймворк для замыкания этого цикла с помощью агентного ревью кода. Имея задачу и сгенерированный ИИ PR, агент-рецензент исследует репозиторий, принимает решение о принятии PR и предоставляет структурированную обратную связь для доработки. Мы оцениваем данную постановку с помощью предложенного нами SWE-Review-Bench для измерения как корректности ревью, так и полезности последующих доработок. Кроме того, мы формируем набор данных SWE-Review-Traj для изучения более широких применений агентного ревью и восполнения дефицита данных для открытого обучения рецензентов. Эксперименты показывают, что агентное ревью непрерывно улучшает PR через цикл «генерация–рецензирование–доработка», превосходит однократное ревью с фиксированным контекстом как по точности решений, так и по доле успешных доработок, переносится за пределы ревью для улучшения моделей решения задач, а также обеспечивает эффективное масштабирование на этапе тестирования. Эти результаты позиционируют агентное ревью кода как практический механизм для перехода от однократной генерации PR к замкнутому циклу решения задач.
English
Coding agents increasingly generate pull requests (PRs) for real-world software issues, yet one-shot PR generation remains open-loop: the PR is proposed without systematic review, diagnosis, or revision. We introduce SWE-Review, a framework for closing this loop with agentic code review. Given an issue and an AI-generated PR, a reviewer agent explores the repository, decides whether the PR should be accepted, and provides structured feedback for revision. We evaluate this setting with our proposed SWE-Review-Bench to measure both review correctness and downstream revision usefulness. We further curate SWE-Review-Traj dataset to study broader applications of agentic review and fill the data-scarcity gap for open reviewer training. Experiments show that agentic review continuously improves PRs through a generate-review-revise loop, outperforms single-turn fixed-context review in both decision accuracy and resolve rate after revision, transfers beyond review to improve issue-resolution models, and enables effective and efficient test-time scaling. These results position agentic code review as a practical mechanism for moving AI coding agents from one-shot PR generation toward closed-loop issue resolution.