Composition LoRA multi-concept sans entraînement avec pondération consciente du prompt
Training-Free Multi-Concept LoRA Composition with Prompt-Aware Weighting
June 2, 2026
Auteurs: Georgios Tsoumplekas, Stella Bounareli, Vasileios Argyriou
cs.AI
Résumé
Low-Rank Adaptation (LoRA) permet avec succès la personnalisation dans la génération texte-image en adaptant des modèles de diffusion pré-entraînés à des concepts visuels et des styles spécifiques. Cependant, étendre ces modèles à la personnalisation multi-concept reste difficile. La combinaison naïve de plusieurs poids LoRA ou de leurs sorties entraîne souvent des interférences entre les concepts, ce qui dégrade la qualité visuelle et réduit la fidélité aux images de référence des concepts individuels. Cet article propose une approche simple mais efficace pour la personnalisation multi-concept en combinant de manière optimale les sorties de plusieurs modules LoRA. Nous exploitons l'importance relative de chaque concept lors de la génération, déduite de ses jetons de prompt correspondants, et introduisons deux méthodes, W-Switch et W-Composite, qui utilisent une stratégie de pondération d'importance sensible au prompt, dans laquelle chaque LoRA est pondéré en fonction de l'influence sémantique de ses mots déclencheurs dans le prompt cible. De plus, nous étendons les métriques d'évaluation quantitatives existantes en proposant un nouveau cadre d'évaluation de similarité basé sur l'image, qui évalue la fidélité de l'image et la préservation de l'identité par des comparaisons entre des images de référence du monde réel et des régions de concept segmentées automatiquement à partir des images générées. Nous évaluons notre approche sur le banc d'essai ComposLoRA et démontrons des améliorations constantes par rapport aux méthodes de pointe existantes en termes de qualité visuelle, de préservation de l'identité et de compositionalité. Les évaluations qualitatives, y compris une évaluation basée sur un modèle de langage de grande taille (LLM) et une étude utilisateur, valident davantage l'efficacité des méthodes proposées et s'alignent sur les nouvelles métriques quantitatives basées sur l'image. Notre code est disponible à l'adresse https://github.com/GeorgeTsoumplekas/Prompt-Aware-Multi-LoRA-Composition.
English
Low-Rank Adaptation (LoRA) successfully enables personalization in text-to-image generation by adapting pre-trained diffusion models to specific visual concepts and styles. However, extending such models to multi-concept customization remains challenging. Naively combining multiple LoRA weights or their outputs often leads to interference among concepts, resulting in degraded visual quality and reduced fidelity to the reference images of individual concepts. This paper proposes a simple yet effective approach for multi-concept customization by optimally combining the outputs of multiple LoRA modules. We leverage the relative importance of each concept during generation, as inferred from its corresponding prompt tokens and introduce two methods, W-Switch and W-Composite, that employ a prompt-aware importance weighting strategy in which each LoRA is weighted according to the semantic influence of its trigger words in the target prompt. In addition, we extend existing quantitative evaluation metrics by proposing a new image-based similarity evaluation framework that assesses image fidelity and identity preservation through comparisons between real-world reference images and automatically segmented concept regions from generated images. We evaluate our approach on the ComposLoRA testbed and demonstrate consistent improvements over existing state-of-the-art methods in terms of visual quality, identity preservation and compositionality. Qualitative evaluations, including a Large Language Model (LLM) based assessment and a user study, further validate the effectiveness of the proposed methods and align with the newly introduced quantitative image-based metrics. Our code is available at https://github.com/GeorgeTsoumplekas/Prompt-Aware-Multi-LoRA-Composition.