SAM-MT: интерактивная многообъектная сегментация видео в реальном времени
SAM-MT: Real-Time Interactive Multi-Target Video Segmentation
July 9, 2026
Авторы: Ruiqi Shen, Chang Liu, Henghui Ding
cs.AI
Аннотация
Современная сегментация объектов видео (VOS) включает отслеживание и сегментирование заданных пользователем целей. Хотя недавние подходы достигли высокой производительности в сценариях с одной целью, их расширение на многоцелевые конфигурации обычно требует дублирования обработки одной цели для каждого отдельного объекта, что приводит к снижению частоты кадров (FPS) с неограниченной задержкой при увеличении количества целей. На основе Segment Anything 2 (SAM2) мы предлагаем SAM-MT, который решает эту проблему, преобразуя модель в интерактивную структуру для сегментации видео с несколькими целями в реальном времени. SAM-MT использует явные запросы для представления различных отдельных целей параллельно с общим представлением глобального контекста. В нем применяется разделенное маскированное внимание для сохранения индивидуальных идентификаторов в условиях перекрестных помех между целями, а также разреженная память для стабильной временной эволюции, наряду со специализированными стратегиями обработки окклюзий и предотвращения перекрытий. SAM-MT успешно отделяет задержку от числа целей, достигая скорости реального времени на уровне базовых алгоритмов для одной цели (>36 FPS для 10 целей), сохраняя при этом надежную производительность сегментации видео SAM2.
English
Modern Video Object Segmentation (VOS) involves tracking and segmenting user-specified targets. While recent approaches have achieved remarkable performance in single-target scenarios, extending them to multi-target settings typically involves replicating the single-target processing for each individual object, resulting in reduced frame rates (FPS) with unbounded latency as target count increases. Built upon Segment Anything 2 (SAM2), we propose SAM-MT, which addresses this by transforming the model into an interactive framework for real-time Multi-Target video segmentation. SAM-MT uses explicit queries to represent different individual targets, in parallel with a shared representation for global context. It employs decoupled masked attention to keep individual identities distinct from cross-target interference, and sparse memory for stable temporal evolution, along with specialized strategies for occlusion handling and overlap prevention. SAM-MT successfully decouples latency from the number of targets, achieving real-time speed on par with single-target baselines (>36 FPS for 10 targets) while maintaining SAM2's robust video segmentation performance.