ChatPaper.aiChatPaper

CollectionLoRA : Collecter 50 effets en 1 LoRA via distillation multi-enseignant sur politique

CollectionLoRA: Collecting 50 Effects in 1 LoRA via Multi-Teacher On-Policy Distillation

May 25, 2026
Auteurs: Fangtai Wu, Hailong Guo, Shijie Huang, Jiayi Song, Yubo Huang, Mushui Liu, Zhao Wang, Yunlong Yu, Jiaming Liu, Ruihua Huang
cs.AI

Résumé

L'édition d'image personnalisée vise à doter les modèles de diffusion pré-entraînés d'effets visuels spécifiques en utilisant des données appariées limitées, généralement via l'adaptation de bas rang (LoRA). À mesure que le nombre d'effets souhaités augmente, le stockage et le chargement dynamique de nombreux LoRA d'effets augmentent considérablement les frais généraux de déploiement. De plus, les pipelines actuels mettent généralement en cascade ces LoRA d'effets avec des modules d'accélération pour une génération rapide, ce qui déclenche une grave interférence de paramètres et entraîne un mélange de concepts (concept bleeding) ainsi qu'une dégradation de style. Nous proposons CollectionLoRA, un cadre de distillation sur politique (on-policy) multi-enseignant capable de distiller les concepts de jusqu'à 50 LoRA d'effets différents, ainsi que les capacités de génération en quelques étapes, en un seul LoRA. Cela résout fondamentalement le problème d'interférence de caractéristiques et réduit considérablement les coûts de déploiement. Plus précisément, la méthode introduit (i) un mécanisme de routage probabiliste à double flux qui permet au modèle de basculer aléatoirement entre les sources de données pendant l'entraînement, améliorant efficacement sa généralisation dans des scénarios non vus ; (ii) une stratégie de prompting orthogonal asymétrique pour réaliser l'isolation des concepts dans l'espace des prompts ; (iii) un objectif de distillation grossier à fin (coarse-to-fine) pour atténuer l'écart de distribution entre les modèles enseignant et étudiant. Des évaluations approfondies montrent que CollectionLoRA distille tous les effets personnalisés et la génération en quelques étapes en un seul LoRA, réduisant les frais de déploiement tout en atteignant une fidélité conceptuelle comparable ou supérieure à celle des modèles enseignants entraînés indépendamment.
English
Customized image editing aims to equip pre-trained diffusion models with specific visual effects using limited paired data, typically via Low-Rank Adaptation (LoRA). As the number of desired effects grows, storing and dynamically loading numerous these effect LoRAs significantly increases deployment overhead. Furthermore, current pipelines typically cascade these effect LoRAs with acceleration modules for fast generation, which triggers severe parameter interference and results in concept bleeding and style degradation. We propose CollectionLoRA, a multi-teacher on-policy distillation framework capable of distilling the concepts of up to 50 different effect LoRAs along with few-step generation capabilities into a single LoRA. This fundamentally resolves the feature interference issue and significantly reduces deployment costs. Specifically, the method introduces (i) a Probabilistic Dual-Stream Routing mechanism that enables the model to randomly switch between data sources during training, effectively enhancing its generalization in unseen scenarios; (ii) an Asymmetric Orthogonal Prompting strategy to achieve concept isolation within the prompt space; (iii) a Coarse-to-Fine Distillation Objective to mitigate the distribution gap between the teacher and student models. Extensive evaluations show that CollectionLoRA distills all customized effects and few-step generation into a single LoRA, reducing deployment overhead while achieving concept fidelity comparable to or better than independently trained teacher models.