Edit-Compass et EditReward-Compass : un référentiel unifié pour l'édition d'images et la modélisation des récompenses
Edit-Compass & EditReward-Compass: A Unified Benchmark for Image Editing and Reward Modeling
May 13, 2026
Auteurs: Xuehai Bai, Yang Shi, Yi-Fan Zhang, Xuanyu Zhu, Yuran Wang, Yifan Dai, Xinyu Liu, Yiyan Ji, Xiaoling Gu, Yuanxing Zhang
cs.AI
Résumé
Les modèles récents d'édition d'images ont réalisé des progrès remarquables en matière de suivi d'instructions, de compréhension multimodale et d'édition visuelle complexe. Cependant, les références existantes ne reflètent souvent pas fidèlement le jugement humain, en particulier pour les modèles de pointe, en raison de la difficulté limitée des tâches et de protocoles d'évaluation à granularité grossière. Parallèlement, les modèles de récompense deviennent de plus en plus importants pour l'optimisation de l'édition d'images basée sur l'apprentissage par renforcement (RL), mais les références actuelles de modèles de récompense reposent encore sur des cadres d'évaluation irréalistes qui s'écartent des scénarios RL pratiques. Ces limitations entravent une évaluation fiable à la fois des modèles d'édition d'images et des modèles de récompense. Pour relever ces défis, nous présentons Edit-Compass et EditReward-Compass, une suite d'évaluation unifiée pour l'édition d'images et la modélisation de récompense. Edit-Compass contient 2 388 instances soigneusement annotées couvrant six catégories de tâches de difficulté progressive, incluant des capacités telles que le raisonnement sur les connaissances du monde, le raisonnement visuel et l'édition multi-images. Au-delà d'une large couverture des tâches, Edit-Compass adopte un cadre d'évaluation multidimensionnelle fine basé sur un raisonnement structuré et des grilles de notation soigneusement conçues. Parallèlement, EditReward-Compass contient 2 251 paires de préférence qui simulent des scénarios réalistes de modélisation de récompense lors de l'optimisation par RL.
English
Recent image editing models have achieved remarkable progress in instruction following, multimodal understanding, and complex visual editing. However, existing benchmarks often fail to faithfully reflect human judgment, especially for strong frontier models, due to limited task difficulty and coarse-grained evaluation protocols. In parallel, reward models have become increasingly important for RL-based image editing optimization, yet existing reward model benchmarks still rely on unrealistic evaluation settings that deviate from practical RL scenarios. These limitations hinder reliable assessment of both image editing models and reward models. To address these challenges, we introduce Edit-Compass and EditReward-Compass, a unified evaluation suite for image editing and reward modeling. Edit-Compass contains 2,388 carefully annotated instances spanning six progressively challenging task categories, covering capabilities such as world knowledge reasoning, visual reasoning, and multi-image editing. Beyond broad task coverage, Edit-Compass adopts a fine-grained multidimensional evaluation framework based on structured reasoning and carefully designed scoring rubrics. In parallel, EditReward-Compass contains 2,251 preference pairs that simulate realistic reward modeling scenarios during RL optimization.