ChatPaper.aiChatPaper

Les modifications textuelles se généralisent-elles à la génération visuelle ? Évaluation comparative de l'édition de connaissances cross-modale dans les modèles multimodaux unifiés (UMM)

Do Text Edits Generalize to Visual Generation? Benchmarking Cross-Modal Knowledge Editing in UMMs

May 30, 2026
Auteurs: Xin Gao, Cheng Yang, Chufan Shi, Taylor Berg-Kirkpatrick
cs.AI

Résumé

Les modèles multimodaux unifiés (UMMs) sont apparus comme un paradigme prometteur pour l'intelligence multimodale à usage général. Alors qu'ils sont déployés dans des applications réelles, la mise à jour efficace des connaissances internes devient cruciale. Bien que l'édition de connaissances ait atteint une certaine maturité pour les modèles purement textuels, il n'est pas clair si les modifications qui réussissent à modifier les sorties textuelles se transfèrent également à la génération d'images dans les UMMs. Pour étudier cette question, nous présentons UniKE, le premier benchmark pour l'édition de connaissances cross-modale dans les UMMs, comprenant 2 971 sujets de modification couvrant des modifications d'attributs et de relations. En utilisant une vérification visuelle basée sur VQA, nous révélons un écart modal frappant : l'efficacité côté texte peut atteindre environ 92 %, alors que la meilleure précision VQA globale sous génération d'images directe n'est que de 18,5 %. Nous proposons en outre le Reasoning-augmented Parameter Editing, qui active explicitement les connaissances modifiées avant la génération et améliore la précision VQA globale pour toutes les paires modèle-éditeur évaluées, avec des gains allant jusqu'à 18,6 points de pourcentage. L'analyse mécaniste montre que cet écart est associé à un alignement partiel entre les représentations textuelles modifiées et les voies de conditionnement pour la génération visuelle, où les modifications suffisantes pour les sorties textuelles peuvent rester trop faibles ou mal alignées pour guider la synthèse d'images. Ces résultats montrent que les modifications de connaissances textuelles ne garantissent pas un transfert cross-modal fiable et motivent le développement de méthodes d'édition tenant compte de la modalité. Notre code et nos données sont disponibles sur https://github.com/gxx27/UniKE.
English
Unified multimodal models (UMMs) have emerged as a promising paradigm for general-purpose multimodal intelligence. As they are deployed in real-world applications, effectively updating internal knowledge becomes critical. While knowledge editing has matured for text-only models, it remains unclear whether edits that successfully modify textual outputs also transfer to image generation in UMMs. To study this question, we introduce UniKE, the first benchmark for cross-modality knowledge editing in UMMs, comprising 2,971 edit subjects spanning attribute and relation edits. Using VQA-based visual verification, we reveal a striking modality gap: text-side efficacy can reach approximately 92%, whereas the best overall VQA accuracy under direct image generation is only 18.5%. We further propose Reasoning-augmented Parameter Editing, which explicitly activates edited knowledge before generation and improves overall VQA accuracy for all evaluated model-editor pairs, with gains up to 18.6 percentage points. Mechanistic analysis shows that this gap is associated with partial alignment between edited textual representations and the conditioning pathways for visual generation, where edits sufficient for text outputs may remain too weak or misaligned to steer image synthesis. These findings show that textual knowledge edits do not guarantee reliable cross-modality transfer and motivate modality-aware editing methods. Our code and data are available at https://github.com/gxx27/UniKE.