MC-RFM : Adaptation few-shot géométriquement consciente via l'appariement de flots riemanniens à courbure mixte
MC-RFM: Geometry-Aware Few-Shot Adaptation via Mixed-Curvature Riemannian Flow Matching
May 8, 2026
Auteurs: Salim Khazem, Ibrahim Mohamed Serouis, Zakaria Ezzahed
cs.AI
Résumé
L'adaptation paramétrique efficace des modèles de vision pré-entraînés est couramment réalisée via des sondes linéaires, des prompts, des mises à jour de faible rang ou des modules résiduels légers. Bien qu'efficaces, ces méthodes traitent généralement l'adaptation comme une perturbation euclidienne discrète des représentations gelées, sans modéliser explicitement la géométrie du déplacement de caractéristiques induit par la tâche. Nous proposons MC-RFM, un cadre d'appariement de flux riemannien à courbure mixte pour l'adaptation few-shot de backbones visuels gelés. L'idée clé est de représenter les caractéristiques adaptées sur une variété produit combinant un facteur hyperbolique, qui capture la structure sémantique sensible à la hiérarchie, et un facteur euclidien, qui préserve la variation visuelle localement discriminante. L'adaptation est formulée comme un transport continu conditionné par la tâche depuis les caractéristiques gelées vers les prototypes de l'ensemble de support, entraîné avec un objectif d'appariement de flux et couplé à un classifieur hybride prototype-linéaire. La méthode est légère, indépendante du backbone, et fonctionne entièrement sur des caractéristiques gelées mises en cache. Sur sept benchmarks de reconnaissance visuelle, cinq backbones gelés et des régimes 1/4/16-shot, MC-RFM est la méthode la plus performante dans la majorité des configurations évaluées, avec les gains les plus importants sur les backbones Transformer et les ensembles de données à granularité fine. Les ablations montrent que la tête à courbure mixte, le conditionnement par tâche, le réglage adaptatif de branches, le rétrécissement des prototypes et la supervision discriminative contribuent chacun à la performance. Ces résultats suggèrent que l'adaptation few-shot bénéficie non seulement de la décision de quels paramètres mettre à jour, mais aussi de la modélisation de la manière dont les représentations devraient se déplacer à travers une géométrie adaptée à la structure de la tâche en aval.
English
Parameter-efficient adaptation of pretrained vision models is commonly performed through linear probes, prompts, low-rank updates, or lightweight residual modules. While effective, these methods usually treat adaptation as a discrete Euclidean perturbation of frozen representations, without explicitly modeling the geometry of the task-induced feature displacement. We propose MC-RFM, a mixed-curvature Riemannian flow-matching framework for few-shot adaptation of frozen visual backbones. The key idea is to represent adapted features on a product manifold combining a hyperbolic factor, which captures hierarchy-sensitive semantic structure, and a Euclidean factor, which preserves locally discriminative visual variation. Adaptation is formulated as a task-conditioned continuous transport from frozen features to support-set prototypes, trained with a flow-matching objective and coupled to a hybrid prototype-linear classifier. The method is lightweight, backbone-agnostic, and operates entirely on cached frozen features. Across seven visual recognition benchmarks, five frozen backbones, and 1/4/16-shot regimes, MC-RFM is the best-performing method in a majority of evaluated settings, with the strongest gains on Transformer backbones and fine-grained datasets. Ablations show that the mixed-curvature head, task conditioning, adaptive branch gating, prototype shrinkage, and discriminative supervision each contribute to performance. These results suggest that few-shot adaptation benefits not only from deciding which parameters to update, but also from modeling how representations should move through a geometry matched to the structure of the downstream task.