SAM-MT: Segmentação de Vídeo em Tempo Real Interativa com Múltiplos Alvos
SAM-MT: Real-Time Interactive Multi-Target Video Segmentation
July 9, 2026
Autores: Ruiqi Shen, Chang Liu, Henghui Ding
cs.AI
Resumo
A Segmentação Moderna de Objetos em Vídeo (VOS) envolve o rastreamento e a segmentação de alvos especificados pelo usuário. Embora abordagens recentes tenham alcançado desempenho notável em cenários de alvo único, sua extensão para configurações de múltiplos alvos geralmente requer a replicação do processamento de alvo único para cada objeto individual, resultando em taxas de quadros (FPS) reduzidas com latência ilimitada à medida que o número de alvos aumenta. Com base no Segment Anything 2 (SAM2), propomos o SAM-MT, que resolve esse problema transformando o modelo em uma estrutura interativa para segmentação de vídeo em tempo real com múltiplos alvos. O SAM-MT utiliza consultas explícitas para representar diferentes alvos individuais, em paralelo com uma representação compartilhada para contexto global. Ele emprega atenção mascarada desacoplada para manter identidades individuais distintas de interferências entre alvos, e memória esparsa para evolução temporal estável, juntamente com estratégias especializadas para tratamento de oclusão e prevenção de sobreposição. O SAM-MT consegue desacoplar a latência do número de alvos, atingindo velocidade em tempo real comparável às referências de alvo único (>36 FPS para 10 alvos), mantendo o desempenho robusto de segmentação de vídeo do SAM2.
English
Modern Video Object Segmentation (VOS) involves tracking and segmenting user-specified targets. While recent approaches have achieved remarkable performance in single-target scenarios, extending them to multi-target settings typically involves replicating the single-target processing for each individual object, resulting in reduced frame rates (FPS) with unbounded latency as target count increases. Built upon Segment Anything 2 (SAM2), we propose SAM-MT, which addresses this by transforming the model into an interactive framework for real-time Multi-Target video segmentation. SAM-MT uses explicit queries to represent different individual targets, in parallel with a shared representation for global context. It employs decoupled masked attention to keep individual identities distinct from cross-target interference, and sparse memory for stable temporal evolution, along with specialized strategies for occlusion handling and overlap prevention. SAM-MT successfully decouples latency from the number of targets, achieving real-time speed on par with single-target baselines (>36 FPS for 10 targets) while maintaining SAM2's robust video segmentation performance.