ChatPaper.aiChatPaper

WebRISE : Évaluation d’état induite par les exigences pour les artefacts Web générés par MLLM

WebRISE: Requirement-Induced State Evaluation for MLLM-Generated Web Artifacts

June 2, 2026
Auteurs: Yuxin Meng, Yuhan Suo, Junjie Wang, Yuhan Sun, Yiyao Yu, Ruixu Zhang, Ruining Hu, Yubin Wang, Shouwei Ruan, Bin Wang, Yuxiang Zhang, Yujiu Yang
cs.AI

Résumé

Les benchmarks existants pour les artefacts web générés par MLLM évaluent l'interaction à partir d'indices locaux et négligent les états et transitions induits par les exigences qui déterminent le fonctionnement d'une page. Nous présentons WebRISE, qui compile les exigences des tâches en graphes de contrats d'interaction (ICG) composés d'états observables, de transitions d'intention utilisateur et d'assertions DOM/visuelles, pour une exécution navigateur indépendante de l'implémentation. WebRISE couvre 442 tâches réparties sur cinq modalités d'entrée (texte, Markdown, croquis, image, vidéo), avec 5 495 transitions et 5 271 vérifications d'exigences qui séparent les fonctions énoncées par l'utilisateur des contraintes implicites au niveau du produit. Sur 14 MLLM, même le modèle le plus performant n'atteint que 65,6 % de validité des transitions et 66,3 % de couverture des exigences, et la qualité visuelle n'est pas un indicateur du comportement (Qwen3.6-35B-A3B sur Markdown : V=80,8 mais T=15,5). La vidéo fournit le signal d'interaction le plus fort (+10,6 points de pourcentage de couverture implicite par rapport au texte), tandis que les contraintes implicites persistent ; l'injection de défauts montre que le score basé sur les ICG détecte les erreurs d'état à un rythme 2 à 16 fois supérieur à celui d'une évaluation de type point de contrôle.
English
Existing benchmarks for MLLM-generated web artifacts assess interaction through local evidence and miss the requirement-induced states and transitions that determine whether a page works. We introduce WebRISE, which compiles task requirements into Interaction Contract Graphs (ICGs) of observable states, user-intent transitions, and DOM/visual assertions for implementation-agnostic browser execution. WebRISE spans 442 tasks across five input modalities (Text, Markdown, Sketch, Image, Video), with 5,495 transitions and 5,271 requirement checks that separate user-stated functions from implicit product-level constraints. Across 14 MLLMs, even the strongest model reaches only 65.6% transition validity and 66.3% requirement coverage, and visual quality is no proxy for behavior (Qwen3.6-35B-A3B on Markdown: V=80.8 yet T=15.5). Video gives the strongest interaction signal (+10.6 pp implicit coverage over Text), while implicit constraints persist; defect injection shows ICG-based scoring detects state errors at 2-16x the rate of checkpoint-style evaluation.