SAM-MT: Segmentación de video interactiva en tiempo real para múltiples objetos
SAM-MT: Real-Time Interactive Multi-Target Video Segmentation
July 9, 2026
Autores: Ruiqi Shen, Chang Liu, Henghui Ding
cs.AI
Resumen
La Segmentación Moderna de Objetos en Video (VOS) implica el seguimiento y la segmentación de objetivos especificados por el usuario. Si bien los enfoques recientes han logrado un rendimiento notable en escenarios de objetivo único, extenderlos a entornos de múltiples objetivos suele implicar replicar el procesamiento de objetivo único para cada objeto individual, lo que resulta en tasas de cuadros (FPS) reducidas con una latencia no acotada a medida que aumenta el número de objetivos. Basándonos en Segment Anything 2 (SAM2), proponemos SAM-MT, que aborda este problema transformando el modelo en un marco interactivo para la segmentación de video en tiempo real con múltiples objetivos. SAM-MT utiliza consultas explícitas para representar diferentes objetivos individuales, en paralelo con una representación compartida para el contexto global. Emplea atención enmascarada desacoplada para mantener identidades individuales libres de interferencias entre objetivos, y memoria dispersa para una evolución temporal estable, junto con estrategias especializadas para el manejo de oclusiones y la prevención de superposiciones. SAM-MT desacopla exitosamente la latencia del número de objetivos, logrando una velocidad en tiempo real comparable a las líneas base de objetivo único (>36 FPS para 10 objetivos), manteniendo al mismo tiempo el rendimiento robusto de segmentación de video de SAM2.
English
Modern Video Object Segmentation (VOS) involves tracking and segmenting user-specified targets. While recent approaches have achieved remarkable performance in single-target scenarios, extending them to multi-target settings typically involves replicating the single-target processing for each individual object, resulting in reduced frame rates (FPS) with unbounded latency as target count increases. Built upon Segment Anything 2 (SAM2), we propose SAM-MT, which addresses this by transforming the model into an interactive framework for real-time Multi-Target video segmentation. SAM-MT uses explicit queries to represent different individual targets, in parallel with a shared representation for global context. It employs decoupled masked attention to keep individual identities distinct from cross-target interference, and sparse memory for stable temporal evolution, along with specialized strategies for occlusion handling and overlap prevention. SAM-MT successfully decouples latency from the number of targets, achieving real-time speed on par with single-target baselines (>36 FPS for 10 targets) while maintaining SAM2's robust video segmentation performance.