PaintBench : Évaluation déterministe de l'édition visuelle précise
PaintBench: Deterministic Evaluation of Precise Visual Editing
May 29, 2026
Auteurs: Kai Xu, Ellis Brown, Shrikar Madhu, Rob Fergus, He He, Saining Xie
cs.AI
Résumé
Alors que les modèles multimodaux actuels sont compétents pour l'édition visuelle ouverte, l'exécution d'éditions précises à réponse unique reste un obstacle important. Pour étudier ce défi, nous présentons PaintBench, un benchmark évolutif dynamiquement ciblant 20 opérations fondamentales d'édition visuelle précise réparties en quatre catégories : transformation géométrique, manipulation structurelle, changement de couleur et raisonnement symbolique. La génération procédurale avec une complexité configurable permet une suite d'évaluation effectivement infinie et résistante à la contamination, tandis que l'évaluation déterministe au niveau du pixel élimine la dépendance à des modèles juges sujets aux biais. Sur 11 modèles d'édition d'images, nous constatons une performance globale faible, le leader industriel actuel le plus performant n'atteignant que 17,1 % (mIoU). La décomposition des tâches révèle des types d'opérations particulièrement difficiles (transformation géométrique, la plupart des manipulations structurelles, changement de couleur basé sur des formules) ainsi que des spécialisations spécifiques aux modèles. Les diagnostics fins du benchmark montrent en outre des dégradations de performance induites par des variations de scène dans le nombre d'objets, la complexité de l'arrière-plan, la palette de couleurs et la taille de la région d'édition. Pour tester la généralisation des scores PaintBench à la performance sur des tâches appliquées, nous créons une évaluation procédurale et déterministe pour l'édition de visualisation de données (TinyGrafixBench) et trouvons une forte corrélation linéaire avec les scores PaintBench (R² = 0,91, p < 0,001). Dans l'ensemble, PaintBench fournit une base rigoureuse pour mesurer et stimuler les progrès en édition visuelle multimodale précise.
English
While current multimodal models are proficient at open-ended visual editing, executing precise single-answer edits remains an important obstacle. To probe this challenge, we introduce PaintBench, a dynamically scalable benchmark targeting 20 fundamental precise visual editing operations across four categories: geometric transformation, structural manipulation, color change, and symbolic reasoning. Procedural generation with configurable complexity enables an effectively infinite, contamination-resistant evaluation suite, and deterministic pixel-level evaluation eliminates reliance on bias-prone judge models. Across 11 image editing models, we find overall low performance, with the current highest-performing industry leader scoring only 17.1% (mIoU). Task decomposition reveals especially challenging operation types (geometric transformation, most structural manipulation, formula-based color change) and model-specific specializations. Fine-grained benchmark diagnostics further show performance degradations induced by scene variations in object count, background complexity, color scheme, and edit-region size. To test generalization of PaintBench scores to applied task performance, we create a procedural, deterministic evaluation for data visualization editing (TinyGrafixBench) and find strong linear correlation with PaintBench scores (R^2 = 0.91, p < 0.001). Altogether, PaintBench provides a rigorous foundation for measuring and driving progress in precise multimodal visual editing.