ChatPaper.aiChatPaper

概念スケーリングと密な監視による画像編集の潜在能力の解き放ち

Unlocking the Potential of Image Editing via Concept Scaling and Dense Supervision

August 17, 2026
著者: Long Cui, Xiaoqian Liu, Qi Qin, Yi Xin, Tao Lin, Jianguo Li, Linfeng Zhang
cs.AI

要旨

既存の画像編集フレームワークは、主にテキストから画像を生成する拡散モデルの学習パラダイムに従っています。しかし、このパラダイムを画像編集に拡張すると、編集コンセプトの粒度への配慮が不十分であることと、疎な監視信号による学習効率の低下という、2つの本質的な不一致が浮き彫りになります。これらの問題に対処するため、我々は1,000以上の細粒度の編集コンセプトを備えた包括的な階層的分類体系を構築し、改良された合成フレームワークを用いて、1,200万組の高品質な編集ペアからなる大規模データセットConceptEdit-12Mを構築しました。このライブラリ駆動型アプローチは、生成データの分布崩壊を効果的に是正するとともに、高いデータ忠実度を保証します。さらに、我々は、干渉しない複数のコンセプトを単一の画像ペアに合成する、密な監視信号による学習戦略を提案します。この戦略は、より豊富な学習信号を提供することにより、学習効率とモデル全体の性能の両方を大幅に向上させます。学習結果は我々の戦略の有効性を検証しており、従来手法を大幅に上回る性能を示しています。最後に、多種多様な実世界シナリオにわたってモデルの能力を診断するための、粒度の細かい評価スイートであるConceptEdit-Benchを提案します。
English
Existing image editing frameworks predominantly follow the training paradigm of text-to-image diffusion models. However, extending this paradigm to image editing highlights two inherent discrepancies, specifically, the insufficient attention to edit concept granularity and the training inefficiency caused by sparse supervision signals. To address these issues, we establish a comprehensive hierarchical taxonomy featuring over 1,000 fine-grained edit concepts and build ConceptEdit-12M, a massive dataset of 12 million high-quality editing pairs via an improved synthesis framework. This library-driven approach effectively rectifies the distribution collapse of generated data while ensuring high data fidelity. Furthermore, we propose a dense supervision training strategy that synthesizes multiple non-interfering concepts into single image pairs. By providing richer learning signals, this strategy significantly enhances both training efficiency and overall model performance. Training results validate our strategy, significantly outperforming prior works. Finally, we present ConceptEdit-Bench, a granular evaluation suite designed to diagnose model capabilities across a vast array of real-world scenarios.