FeatCal : Calibration des caractéristiques pour les modèles post-fusion
FeatCal: Feature Calibration for Post-Merging Models
May 13, 2026
Auteurs: Yanggan Gu, Shuo Cai, Zihao Wang, Wenjun Wang, Yuanyi Wang, Pengkai Wang, Sirui Huang, Su Lu, Jianmin Wu, Hongxia Yang
cs.AI
Résumé
La fusion de modèles combine des experts de tâches en un seul modèle et évite l'entraînement conjoint, le réentraînement ou le déploiement de nombreux modèles experts, mais le modèle fusionné sous-performe souvent encore les experts de tâches. Nous étudions cet écart de performance à travers la dérive des caractéristiques, c'est-à-dire la différence entre les caractéristiques produites par le modèle fusionné et celles produites par l'expert sur la même entrée. Notre théorie décompose cette dérive en propagation amont et décalage local, suit la manière dont elle se propage et se combine à travers les couches ultérieures dans l'ordre avant, et relie la dérive finale des caractéristiques à la dérive de sortie. Cette vision motive FeatCal, qui utilise un petit ensemble de calibration pour calibrer les poids du modèle fusionné couche par couche dans l'ordre avant, réduisant ainsi la dérive des caractéristiques tout en restant proche des poids fusionnés et en préservant les avantages de la fusion de modèles. FeatCal utilise une solution de forme fermée efficace pour mettre à jour les poids du modèle, sans descente de gradient, optimisation itérative ni modules supplémentaires. Sur les principaux référentiels CLIP et GLUE, FeatCal surpasse Surgery et ProbSurgery, les bases de référence de calibration post-fusion les plus proches : 85,5 % contre 77,0 %/78,8 % sur CLIP-ViT-B/32 Task Arithmetic (TA) et 85,2 % contre 83,7 %/82,2 % sur FLAN-T5-base GLUE. Sur CLIP-ViT-B/32, 8 exemples par tâche atteignent 82,9 %, et 256 exemples par tâche prennent 53 secondes, soit environ 4 fois plus vite que les deux bases de référence, démontrant une meilleure efficacité d'échantillonnage et un coût de calibration plus faible.
English
Model merging combines task experts into one model and avoids joint training, retraining, or deploying many expert models, but the merged model often still underperforms task experts. We study this performance gap through feature drift, the difference between features produced by the merged model and by the expert on the same input. Our theory decomposes this drift into upstream propagation and local mismatch, tracks how it propagates and combines through later layers in forward order, and links final feature drift to output drift. This view motivates FeatCal, which uses a small calibration set to calibrate the merged model weights layer by layer in forward order, reducing feature drift while staying close to merged weights and preserving the benefits of model merging. FeatCal uses an efficient closed-form solution to update model weights, with no gradient descent, iterative optimization, or extra modules. On the main CLIP and GLUE benchmarks, FeatCal beats Surgery and ProbSurgery, the closest post-merging calibration baselines: 85.5% vs. 77.0%/78.8% on CLIP-ViT-B/32 Task Arithmetic (TA) and 85.2% vs. 83.7%/82.2% on FLAN-T5-base GLUE. On CLIP-ViT-B/32, 8 examples per task reach 82.9%, and 256 examples per task take 53 seconds, about 4x faster than both baselines, showing better sample efficiency and lower calibration cost.