ChatPaper.aiChatPaper

SAM-MT : segmentation vidéo interactive multi-cible en temps réel

SAM-MT: Real-Time Interactive Multi-Target Video Segmentation

July 9, 2026
Auteurs: Ruiqi Shen, Chang Liu, Henghui Ding
cs.AI

Résumé

La segmentation d'objets vidéo moderne (VOS) implique le suivi et la segmentation de cibles spécifiées par l'utilisateur. Bien que les approches récentes aient atteint des performances remarquables dans les scénarios à cible unique, leur extension aux contextes multi-cibles nécessite généralement de dupliquer le traitement pour chaque objet individuel, ce qui entraîne une réduction du taux d'images (FPS) avec une latence non bornée à mesure que le nombre de cibles augmente. Construit sur Segment Anything 2 (SAM2), nous proposons SAM-MT, qui résout ce problème en transformant le modèle en un cadre interactif pour la segmentation vidéo multi-cibles en temps réel. SAM-MT utilise des requêtes explicites pour représenter différentes cibles individuelles, en parallèle avec une représentation partagée pour le contexte global. Il emploie une attention masquée découplée pour préserver les identités individuelles des interférences entre cibles, ainsi qu'une mémoire éparse pour une évolution temporelle stable, accompagnée de stratégies spécialisées pour la gestion des occlusions et la prévention des chevauchements. SAM-MT réussit à découpler la latence du nombre de cibles, atteignant une vitesse en temps réel comparable aux modèles de base à cible unique (>36 FPS pour 10 cibles) tout en maintenant les performances robustes de segmentation vidéo de SAM2.
English
Modern Video Object Segmentation (VOS) involves tracking and segmenting user-specified targets. While recent approaches have achieved remarkable performance in single-target scenarios, extending them to multi-target settings typically involves replicating the single-target processing for each individual object, resulting in reduced frame rates (FPS) with unbounded latency as target count increases. Built upon Segment Anything 2 (SAM2), we propose SAM-MT, which addresses this by transforming the model into an interactive framework for real-time Multi-Target video segmentation. SAM-MT uses explicit queries to represent different individual targets, in parallel with a shared representation for global context. It employs decoupled masked attention to keep individual identities distinct from cross-target interference, and sparse memory for stable temporal evolution, along with specialized strategies for occlusion handling and overlap prevention. SAM-MT successfully decouples latency from the number of targets, achieving real-time speed on par with single-target baselines (>36 FPS for 10 targets) while maintaining SAM2's robust video segmentation performance.