PixCon: Aprendizaje Contrastivo Limpio-Positivo para Segmentación Semi-Supervisada con Modelos Fundacionales
PixCon: Clean-Positive Contrastive Learning for Foundation-Model Semi-Supervised Segmentation
July 3, 2026
Autores: Ebenezer Tarubinga
cs.AI
Resumen
La segmentación semántica semi-supervisada (SSSS) ha girado durante mucho tiempo en torno a una cuestión: en qué pseudoetiquetas confiar, respondiéndola con un filtrado de confianza cada vez más cuidadoso. Los backbones fundacionales cambian el paradigma: con un maestro DINOv2, un umbral estricto ya retiene un conjunto de pseudoetiquetas medido como 98% limpio, por lo que la precisión restante no reside en el filtro, sino en cómo el espacio de incrustaciones está estructurado por clase. Proponemos PixCon, un marco de contraste de píxeles limpios positivos. PixCon mantiene un banco de memoria por clase que admite únicamente píxeles etiquetados que el estudiante ya clasifica correctamente, garantizando por construcción un conjunto positivo libre de contaminación (ρ_F=0), a diferencia de bancos de contraste SSSS previos (ReCo, U²PL) construidos a partir de pseudoetiquetas filtradas por confianza. Es una sola rama sobre un backbone de consistencia, no añade parámetros en tiempo de inferencia y no necesita un umbral específico del banco. Un análisis de primer orden del gradiente de InfoNCE supervisado explica por qué la contaminación perjudica: su término de falso positivo escala como ρ_F/(1-ρ_F), el cual medimos (0.018 en Pascal, 0.106 en ADE20K) en lugar de asumir. En Pascal VOC, Cityscapes y ADE20K, PixCon iguala o mejora una línea base sólida UniMatch V2 basada en DINOv2 en un protocolo de un solo interruptor con cómputo equiparable: mejora cada semilla de Pascal-1/8 (una ganancia por semilla de aproximadamente +0.2 mIoU) y su media de tres semillas alcanza 87.90, la cifra publicada de UniMatch V2-B. Dado que la contaminación ya es rara bajo maestros de modelos fundacionales, nuestro análisis indica que la garantía ρ_F=0 actúa principalmente como robustez cuando los maestros se debilitan, mientras que la ganancia en precisión proviene de una supervisión positiva más limpia, convirtiendo el contraste de positivos limpios en un valor predeterminado robusto y de bajo costo para SSSS con modelos fundacionales.
English
Semi-supervised semantic segmentation (SSSS) has long turned on one question, which pseudo-labels to trust, and answered it with ever more careful confidence filtering. Foundation backbones change the regime: with a DINOv2 teacher a strict threshold already retains a measured 98%-clean pseudo-label set, so the accuracy that remains lives not in the filter but in how the embedding space is structured by class. We propose PixCon, a clean-positive pixel-contrastive framework. PixCon maintains a per-class memory bank that admits only labeled pixels the student already classifies correctly, guaranteeing a contamination-free positive set (ρ_F=0) by construction, unlike prior contrastive SSSS banks (ReCo, U^2PL) built from confidence-filtered pseudo-labels. It is a single branch over a consistency backbone, adds no inference-time parameters, and needs no bank-specific threshold. A first-order analysis of the supervised-InfoNCE gradient explains why contamination hurts: its false-positive term scales as ρ_F/(1-ρ_F), which we measure (0.018 on Pascal, 0.106 on ADE20K) rather than assume. Across Pascal VOC, Cityscapes, and ADE20K, PixCon matches or improves a strong DINOv2-based UniMatch V2 baseline in a compute-matched one-switch protocol: it improves every Pascal-1/8 seed (a per-seed gain of about +0.2 mIoU) and its three-seed mean reaches 87.90, the published UniMatch V2-B figure. Because contamination is already rare under foundation-model teachers, our analysis indicates the ρ_F=0 guarantee acts chiefly as robustness as teachers weaken, while the accuracy gain comes from cleaner positive supervision, making clean-positive contrast a robust, low-cost default for foundation-model SSSS.