PixCon: Контрастивное обучение с чистыми положительными примерами для полуконтролируемой сегментации на основе фундаментальной модели
PixCon: Clean-Positive Contrastive Learning for Foundation-Model Semi-Supervised Segmentation
July 3, 2026
Авторы: Ebenezer Tarubinga
cs.AI
Аннотация
Полуконтролируемая семантическая сегментация (SSSS) долгое время опиралась на один вопрос — каким псевдо-меткам доверять, — и отвечала на него всё более тщательной фильтрацией по достоверности. Фундаментальные основы меняют парадигму: при использовании учителя DINOv2 строгий порог уже сохраняет измеряемый 98%-чистый набор псевдо-меток, так что точность теперь resides не в фильтре, а в том, как пространство вложений структурировано по классам. Мы предлагаем PixCon — фреймворк чистоположительного пиксельного контрастирования. PixCon поддерживает банк памяти для каждого класса, в который допускаются только помеченные пиксели, уже правильно классифицируемые учеником, что гарантирует контаминационно-свободное положительное множество (ρ_F=0) по построению, в отличие от предыдущих контрастивных банков SSSS (ReCo, U²PL), основанных на псевдо-метках, отфильтрованных по достоверности. Это единственная ветвь над консистентным остовом, не добавляющая параметров на этапе вывода и не требующая порога, специфичного для банка. Анализ градиента контролируемой InfoNCE первого порядка объясняет, почему контаминация вредит: её ложноположительный член масштабируется как ρ_F/(1-ρ_F), что мы измеряем (0.018 на Pascal, 0.106 на ADE20K), а не предполагаем. На Pascal VOC, Cityscapes и ADE20K PixCon соответствует или превосходит сильный базовый метод UniMatch V2 на основе DINOv2 в протоколе с одним переключением при равных вычислительных затратах: он улучшает каждое начальное состояние Pascal-1/8 (прирост около +0.2 mIoU на начальное состояние), а его среднее по трём начальным состояниям достигает 87.90 — опубликованного значения UniMatch V2-B. Поскольку контаминация уже редка при учителях на основе фундаментальных моделей, наш анализ показывает, что гарантия ρ_F=0 действует в основном как устойчивость при ослаблении учителей, тогда как прирост точности обусловлен более чистой положительной супервизией, что делает чистоположительное контрастирование надёжным и малозатратным выбором по умолчанию для SSSS на фундаментальных моделях.
English
Semi-supervised semantic segmentation (SSSS) has long turned on one question, which pseudo-labels to trust, and answered it with ever more careful confidence filtering. Foundation backbones change the regime: with a DINOv2 teacher a strict threshold already retains a measured 98%-clean pseudo-label set, so the accuracy that remains lives not in the filter but in how the embedding space is structured by class. We propose PixCon, a clean-positive pixel-contrastive framework. PixCon maintains a per-class memory bank that admits only labeled pixels the student already classifies correctly, guaranteeing a contamination-free positive set (ρ_F=0) by construction, unlike prior contrastive SSSS banks (ReCo, U^2PL) built from confidence-filtered pseudo-labels. It is a single branch over a consistency backbone, adds no inference-time parameters, and needs no bank-specific threshold. A first-order analysis of the supervised-InfoNCE gradient explains why contamination hurts: its false-positive term scales as ρ_F/(1-ρ_F), which we measure (0.018 on Pascal, 0.106 on ADE20K) rather than assume. Across Pascal VOC, Cityscapes, and ADE20K, PixCon matches or improves a strong DINOv2-based UniMatch V2 baseline in a compute-matched one-switch protocol: it improves every Pascal-1/8 seed (a per-seed gain of about +0.2 mIoU) and its three-seed mean reaches 87.90, the published UniMatch V2-B figure. Because contamination is already rare under foundation-model teachers, our analysis indicates the ρ_F=0 guarantee acts chiefly as robustness as teachers weaken, while the accuracy gain comes from cleaner positive supervision, making clean-positive contrast a robust, low-cost default for foundation-model SSSS.