Des pixels aux concepts : Les modèles de segmentation comprennent-ils ce qu'ils segmentent ?
From Pixels to Concepts: Do Segmentation Models Understand What They Segment?
May 10, 2026
Auteurs: Shuang Liang, Zeqing Wang, Yuxian Li, Xihui Liu, Han Wang
cs.AI
Résumé
La segmentation est une tâche fondamentale de la vision qui sous-tend de nombreuses applications en aval. Les récents modèles de segmentation à base de prompts, tels que le Segment Anything Model 3 (SAM3), étendent la segmentation de la prédiction de masques indépendamment des catégories jusqu'à un guidage conceptuel conditionné par des prompts textuels de haut niveau. Cependant, les benchmarks existants évaluent principalement la précision des masques ou la présence d'objets, sans déterminer clairement si ces modèles ancrent fidèlement le concept sollicité ou s'appuient plutôt sur des indices visuellement saillants mais sémantiquement trompeurs. Nous présentons CAFE : Counterfactual Attribute Factuality Evaluation, un nouveau benchmark pour évaluer la segmentation fidèle au concept dans les modèles de segmentation à base de prompts. Notre CAFE repose sur une manipulation contrefactuelle au niveau des attributs : la région cible et le masque de vérité terrain sont conservés, tandis que des attributs tels que l'apparence de surface, le contexte ou la composition matérielle sont modifiés afin d'introduire des indices sémantiques trompeurs. Le benchmark contient 2 146 échantillons de test appariés, chacun comprenant une image cible, un masque de vérité terrain, un prompt positif et un prompt négatif trompeur. Ces échantillons couvrent trois catégories contrefactuelles : le Mimétisme Superficiel (SM), le Conflit de Contexte (CC) et le Conflit Ontologique (OC). Nous évaluons différents types et tailles de modèles sur notre CAFE. Les expériences révèlent un écart systématique entre la qualité de la localisation et la discrimination conceptuelle : les modèles génèrent souvent des masques précis même pour des prompts trompeurs, ce qui suggère qu'une forte prédiction de masques n'implique pas nécessairement un ancrage sémantique fidèle. Notre CAFE fournit un benchmark contrôlé pour diagnostiquer si les modèles de segmentation à base de prompts effectuent un ancrage fidèle au concept plutôt qu'une récupération de masques guidée par des raccourcis.
English
Segmentation is a fundamental vision task underlying numerous downstream applications. Recent promptable segmentation models, such as Segment Anything Model 3 (SAM3), extend segmentation from category-agnostic mask prediction to concept-guided localization conditioned on high-level textual prompts. However, existing benchmarks primarily evaluate mask accuracy or object presence, leaving unclear whether these models faithfully ground the queried concept or instead rely on visually salient but semantically misleading cues. We introduce CAFE: Counterfactual Attribute Factuality Evaluation, a novel benchmark for evaluating concept-faithful segmentation in promptable segmentation models. Our CAFE is built on attribute-level counterfactual manipulation: the target region and ground-truth mask are preserved, while attributes such as surface appearance, context, or material composition are modified to introduce misleading semantic cues. The benchmark contains 2,146 paired test samples, each consisting of a target image, a ground-truth mask, a positive prompt, and a misleading negative prompt. These samples cover three counterfactual categories: Superficial Mimicry (SM), Context Conflict (CC), and Ontological Conflict (OC). We evaluate various model types and sizes on our CAFE. Experiments reveal a systematic gap between localization quality and concept discrimination: models often generate accurate masks even for misleading prompts, suggesting that strong mask prediction does not necessarily imply faithful semantic grounding. Our CAFE provides a controlled benchmark for diagnosing whether promptable segmentation models perform concept-faithful grounding rather than shortcut-driven mask retrieval.