PixCon: Aprendizado Contrastivo Limpo-Positivo para Segmentação Semissupervisionada com Modelo de Fundação
PixCon: Clean-Positive Contrastive Learning for Foundation-Model Semi-Supervised Segmentation
July 3, 2026
Autores: Ebenezer Tarubinga
cs.AI
Resumo
A segmentação semântica semissupervisionada (SSSS) há muito se concentra em uma questão: em quais pseudo-rótulos confiar, e a respondeu com uma filtragem de confiança cada vez mais criteriosa. As arquiteturas de base fundamentais mudam o regime: com um professor DINOv2, um limiar estrito já retém um conjunto medido de pseudo-rótulos com 98% de pureza, de modo que a precisão restante não reside no filtro, mas na forma como o espaço de embeddings é estruturado por classe. Propomos o PixCon, uma estrutura de contraste positivo entre pixels limpos. O PixCon mantém um banco de memória por classe que admite apenas pixels rotulados que o estudante já classifica corretamente, garantindo um conjunto positivo livre de contaminação (ρ_F=0) por construção, diferentemente dos bancos de contraste SSSS anteriores (ReCo, U²PL) construídos a partir de pseudo-rótulos filtrados por confiança. Trata-se de um único ramo sobre uma arquitetura de consistência, não adiciona parâmetros em tempo de inferência e não requer um limiar específico para o banco. Uma análise de primeira ordem do gradiente da InfoNCE supervisionada explica por que a contaminação é prejudicial: seu termo falso positivo escala como ρ_F/(1-ρ_F), que medimos (0,018 no Pascal, 0,106 no ADE20K) em vez de assumir. Em Pascal VOC, Cityscapes e ADE20K, o PixCon iguala ou melhora uma forte linha de base UniMatch V2 baseada em DINOv2 em um protocolo de uma troca com correspondência computacional: melhora todas as sementes do Pascal-1/8 (um ganho por semente de cerca de +0,2 mIoU) e sua média de três sementes atinge 87,90, o valor publicado do UniMatch V2-B. Como a contaminação já é rara sob professores de modelos fundamentais, nossa análise indica que a garantia ρ_F=0 atua principalmente como robustez à medida que os professores enfraquecem, enquanto o ganho de precisão vem de uma supervisão positiva mais limpa, tornando o contraste positivo limpo uma opção robusta e de baixo custo para SSSS com modelos fundamentais.
English
Semi-supervised semantic segmentation (SSSS) has long turned on one question, which pseudo-labels to trust, and answered it with ever more careful confidence filtering. Foundation backbones change the regime: with a DINOv2 teacher a strict threshold already retains a measured 98%-clean pseudo-label set, so the accuracy that remains lives not in the filter but in how the embedding space is structured by class. We propose PixCon, a clean-positive pixel-contrastive framework. PixCon maintains a per-class memory bank that admits only labeled pixels the student already classifies correctly, guaranteeing a contamination-free positive set (ρ_F=0) by construction, unlike prior contrastive SSSS banks (ReCo, U^2PL) built from confidence-filtered pseudo-labels. It is a single branch over a consistency backbone, adds no inference-time parameters, and needs no bank-specific threshold. A first-order analysis of the supervised-InfoNCE gradient explains why contamination hurts: its false-positive term scales as ρ_F/(1-ρ_F), which we measure (0.018 on Pascal, 0.106 on ADE20K) rather than assume. Across Pascal VOC, Cityscapes, and ADE20K, PixCon matches or improves a strong DINOv2-based UniMatch V2 baseline in a compute-matched one-switch protocol: it improves every Pascal-1/8 seed (a per-seed gain of about +0.2 mIoU) and its three-seed mean reaches 87.90, the published UniMatch V2-B figure. Because contamination is already rare under foundation-model teachers, our analysis indicates the ρ_F=0 guarantee acts chiefly as robustness as teachers weaken, while the accuracy gain comes from cleaner positive supervision, making clean-positive contrast a robust, low-cost default for foundation-model SSSS.