PixCon: Schoon-Positief Contrastief Leren voor Foundation-Model Semi-Gesuperviseerde Segmentatie
PixCon: Clean-Positive Contrastive Learning for Foundation-Model Semi-Supervised Segmentation
July 3, 2026
Auteurs: Ebenezer Tarubinga
cs.AI
Samenvatting
Semi-gesuperviseerde semantische segmentatie (SSSS) draait al lang om één vraag: welke pseudo-labels zijn te vertrouwen? En die vraag wordt beantwoord met steeds zorgvuldigere betrouwbaarheidsfiltering. Fundamentele backbones veranderen het regime: met een DINOv2-docent behoudt een strikte drempel al een gemeten 98%-schone set pseudo-labels, dus de nauwkeurigheid die overblijft zit niet in de filter maar in hoe de inbeddingsruimte door klasse is gestructureerd. Wij stellen PixCon voor, een schoon-positief pixel-contrastief raamwerk. PixCon onderhoudt een per-klasse geheugenbank die alleen gelabelde pixels toelaat die de student al correct classificeert, wat per constructie een besmettingsvrije positieve set (ρ_F=0) garandeert, in tegenstelling tot eerdere contrastieve SSSS-banken (ReCo, U^2PL) die zijn gebouwd uit met betrouwbaarheid gefilterde pseudo-labels. Het is een enkele tak over een consistentie-backbone, voegt geen parameters toe tijdens inferentie en heeft geen bankspecifieke drempel nodig. Een eerste-orde analyse van de gesuperviseerde InfoNCE-gradiënt verklaart waarom contaminatie schaadt: de vals-positieve term schaalt als ρ_F/(1-ρ_F), die we meten (0,018 op Pascal, 0,106 op ADE20K) in plaats van aannemen. Op Pascal VOC, Cityscapes en ADE20K evenaart of verbetert PixCon een sterke DINOv2-gebaseerde UniMatch V2-baseline in een rekenkracht-gematcht een-schakelprotocol: het verbetert elk Pascal-1/8 seed (een winst per seed van ongeveer +0,2 mIoU) en het drie-seed gemiddelde bereikt 87,90, de gepubliceerde UniMatch V2-B waarde. Omdat contaminatie al zeldzaam is onder foundation-model docenten, geeft onze analyse aan dat de ρ_F=0-garantie voornamelijk fungeert als robuustheid naarmate docenten verzwakken, terwijl de nauwkeurigheidswinst voortkomt uit schonere positieve supervisie, waardoor schoon-positief contrast een robuuste, goedkope standaardoptie wordt voor foundation-model SSSS.
English
Semi-supervised semantic segmentation (SSSS) has long turned on one question, which pseudo-labels to trust, and answered it with ever more careful confidence filtering. Foundation backbones change the regime: with a DINOv2 teacher a strict threshold already retains a measured 98%-clean pseudo-label set, so the accuracy that remains lives not in the filter but in how the embedding space is structured by class. We propose PixCon, a clean-positive pixel-contrastive framework. PixCon maintains a per-class memory bank that admits only labeled pixels the student already classifies correctly, guaranteeing a contamination-free positive set (ρ_F=0) by construction, unlike prior contrastive SSSS banks (ReCo, U^2PL) built from confidence-filtered pseudo-labels. It is a single branch over a consistency backbone, adds no inference-time parameters, and needs no bank-specific threshold. A first-order analysis of the supervised-InfoNCE gradient explains why contamination hurts: its false-positive term scales as ρ_F/(1-ρ_F), which we measure (0.018 on Pascal, 0.106 on ADE20K) rather than assume. Across Pascal VOC, Cityscapes, and ADE20K, PixCon matches or improves a strong DINOv2-based UniMatch V2 baseline in a compute-matched one-switch protocol: it improves every Pascal-1/8 seed (a per-seed gain of about +0.2 mIoU) and its three-seed mean reaches 87.90, the published UniMatch V2-B figure. Because contamination is already rare under foundation-model teachers, our analysis indicates the ρ_F=0 guarantee acts chiefly as robustness as teachers weaken, while the accuracy gain comes from cleaner positive supervision, making clean-positive contrast a robust, low-cost default for foundation-model SSSS.