ChatPaper.aiChatPaper

PixCon : Apprentissage contrastif à positives propres pour la segmentation semi-supervisée par modèle fondation

PixCon: Clean-Positive Contrastive Learning for Foundation-Model Semi-Supervised Segmentation

July 3, 2026
Auteurs: Ebenezer Tarubinga
cs.AI

Résumé

La segmentation sémantique semi-supervisée (SSSS) s’est longtemps articulée autour d’une question – quelles pseudo-étiquettes faut-il croire ? – et y a répondu par un filtrage de confiance toujours plus prudent. Les architectures de fondation changent la donne : avec un enseignant DINOv2, un seuil strict retient déjà un ensemble de pseudo-étiquettes mesuré à 98 % de propreté, de sorte que la précision qui subsiste ne réside pas dans le filtre, mais dans la manière dont l’espace de plongement est structuré par les classes. Nous proposons PixCon, un cadre contrastif de pixels propres-positifs. PixCon maintient une banque de mémoire par classe qui n’admet que les pixels étiquetés que l’élève classifie déjà correctement, garantissant par construction un ensemble positif sans contamination (ρ_F=0), contrairement aux banques contrastives SSSS antérieures (ReCo, U²PL) construites à partir de pseudo-étiquettes filtrées par confiance. Il s’agit d’une branche unique reposant sur une architecture de cohérence, n’ajoute aucun paramètre au moment de l’inférence et ne nécessite aucun seuil spécifique à la banque. Une analyse de premier ordre du gradient de l’InfoNCE supervisé explique pourquoi la contamination est nuisible : son terme de faux positif est proportionnel à ρ_F/(1-ρ_F), que nous mesurons (0,018 sur Pascal, 0,106 sur ADE20K) plutôt que de le supposer. Sur Pascal VOC, Cityscapes et ADE20K, PixCon égale ou améliore une baseline robuste UniMatch V2 basée sur DINOv2 dans le cadre d’un protocole one-switch avec correspondance de calcul : il améliore chaque graine Pascal-1/8 (un gain d’environ +0,2 mIoU par graine) et sa moyenne sur trois graines atteint 87,90, soit le chiffre publié d’UniMatch V2-B. La contamination étant déjà rare sous les enseignants de type modèle de fondation, notre analyse indique que la garantie ρ_F=0 agit principalement comme une robustesse lorsque les enseignants s’affaiblissent, tandis que le gain de précision provient d’une supervision positive plus propre, faisant du contraste propre-positif un choix par défaut robuste et peu coûteux pour la SSSS avec modèles de fondation.
English
Semi-supervised semantic segmentation (SSSS) has long turned on one question, which pseudo-labels to trust, and answered it with ever more careful confidence filtering. Foundation backbones change the regime: with a DINOv2 teacher a strict threshold already retains a measured 98%-clean pseudo-label set, so the accuracy that remains lives not in the filter but in how the embedding space is structured by class. We propose PixCon, a clean-positive pixel-contrastive framework. PixCon maintains a per-class memory bank that admits only labeled pixels the student already classifies correctly, guaranteeing a contamination-free positive set (ρ_F=0) by construction, unlike prior contrastive SSSS banks (ReCo, U^2PL) built from confidence-filtered pseudo-labels. It is a single branch over a consistency backbone, adds no inference-time parameters, and needs no bank-specific threshold. A first-order analysis of the supervised-InfoNCE gradient explains why contamination hurts: its false-positive term scales as ρ_F/(1-ρ_F), which we measure (0.018 on Pascal, 0.106 on ADE20K) rather than assume. Across Pascal VOC, Cityscapes, and ADE20K, PixCon matches or improves a strong DINOv2-based UniMatch V2 baseline in a compute-matched one-switch protocol: it improves every Pascal-1/8 seed (a per-seed gain of about +0.2 mIoU) and its three-seed mean reaches 87.90, the published UniMatch V2-B figure. Because contamination is already rare under foundation-model teachers, our analysis indicates the ρ_F=0 guarantee acts chiefly as robustness as teachers weaken, while the accuracy gain comes from cleaner positive supervision, making clean-positive contrast a robust, low-cost default for foundation-model SSSS.