SWE-WebDevBench: Avaliando Plataformas de Agentes de Codificação como Agências de Software Virtuais
SWE-WebDevBench: Evaluating Coding Agent Application Platforms as Virtual Software Agencies
May 6, 2026
Autores: Siddhant Saxena, Nilesh Trivedi, Vinayaka Jyothi
cs.AI
Resumo
O surgimento de plataformas de "codificação por vibração" (vibe coding), nas quais os utilizadores descrevem aplicações em linguagem natural e agentes de IA geram software full-stack de forma autónoma, criou a necessidade de uma avaliação rigorosa para além dos benchmarks a nível de código. Para as avaliar como agências virtuais de desenvolvimento de software na compreensão de requisitos de negócio, tomada de decisões de arquitetura, escrita de código de produção, gestão de modificações iterativas e manutenção da prontidão para negócio, introduzimos o SWE-WebDev Bench, um framework de avaliação com 68 métricas, abrangendo 25 métricas primárias e 43 métricas de diagnóstico, organizado em sete grupos e ao longo de três dimensões: Modo de Interação (Pedido de Criação de Aplicação (ACR) vs. Pedido de Modificação de Aplicação (AMR)), Ângulo da Agência (Gestor de Produto (PM), Engenharia, Operações) e Nível de Complexidade (T4 SaaS multi-função, T5 AI-native).
A nossa avaliação (seis plataformas, três domínios, 18 células de avaliação) revela quatro deficiências recorrentes na geração atual de construtores de aplicações de IA: (1) Um estrangulamento na especificação, onde as plataformas comprimem requisitos de negócio ricos em planos técnicos excessivamente simplificados, (2) Um desacoplamento generalizado entre frontend e backend, onde IU visualmente polidas mascaravam infraestruturas de backend ausentes ou defeituosas, (3) Um declive acentuado de prontidão para produção, onde nenhuma plataforma pontuou acima de 60% na qualidade de engenharia e o esforço humano pós-geração variou substancialmente entre plataformas, e (4) Falhas generalizadas de segurança e infraestrutura, com nenhuma plataforma a exceder 65% no Score de Segurança face a uma meta de 90% e uma capacidade de gestão de concorrência tão baixa quanto 6%. Estas observações são descritivas da nossa amostra e requerem replicação em maior escala para estabelecer generalidade. Disponibilizamos o SWE-WebDev Bench como um benchmark comunitário para permitir tal replicação e ajudar os construtores de plataformas a identificar e colmatar estas lacunas.
O código e os recursos do benchmark estão disponíveis em: https://github.com/snowmountainAi/webdevbench e https://webdevbench.com/.
English
The emergence of "vibe coding" platforms, where users describe applications in natural language and AI agents autonomously generate full-stack software, has created a need for rigorous evaluation beyond code-level benchmarks. In order to assess them as virtual software development agencies on understanding business requirements, making architectural decisions, writing production code, handling iterative modifications, and maintaining business readiness, we introduce SWE-WebDev Bench, a 68-metric evaluation framework spanning 25 primary and 43 diagnostic metrics across seven groups, organized along three dimensions: Interaction Mode (App Creation Request (ACR) vs. App Modification Request (AMR)), Agency Angle (Product Manager (PM), Engineering, Ops), and Complexity Tier (T4 multi-role SaaS, T5 AI-native).
Our evaluation (six platforms, three domains, 18 evaluation cells) reveals four recurring shortcomings in the current generation of AI app builders: (1) A specification bottleneck, where platforms compress rich business requirements into oversimplified technical plans, (2) A pervasive frontend-backend decoupling, where visually polished UIs mask absent or broken backend infrastructure, (3) A steep production-readiness cliff, where no platform scores above 60% on engineering quality and post-generation human effort varies substantially across platforms and (4) Widespread security and infrastructure failures, with no platform exceeding 65% Security Score against a 90% target and concurrency handling as low as 6%. These observations are descriptive of our sample and require larger-scale replication to establish generality. We release SWE-WebDev Bench as a community benchmark to enable such replication and help platform builders identify and address these gaps.
Code and benchmark resources are available at: https://github.com/snowmountainAi/webdevbench and https://webdevbench.com/.