ChatPaper.aiChatPaper

SAM-MT: Real-Time Interactieve Multi-Doel Videosegmentatie

SAM-MT: Real-Time Interactive Multi-Target Video Segmentation

July 9, 2026
Auteurs: Ruiqi Shen, Chang Liu, Henghui Ding
cs.AI

Samenvatting

Moderne Video Object Segmentation (VOS) omvat het volgen en segmenteren van door de gebruiker gespecificeerde doelwitten. Hoewel recente benaderingen opmerkelijke prestaties hebben behaald in scenario's met één enkelvoudig doelwit, leidt het uitbreiden naar instellingen met meerdere doelwitten doorgaans tot het repliceren van de verwerking van enkelvoudige doelwitten voor elk individueel object, wat resulteert in een verlaagde beeldverwerkingssnelheid (FPS) met onbegrensde latentie naarmate het aantal doelwitten toeneemt. Gebaseerd op Segment Anything 2 (SAM2), stellen wij SAM-MT voor, dat dit probleem aanpakt door het model om te vormen tot een interactief raamwerk voor real-time videosegmentatie van meerdere doelwitten. SAM-MT gebruikt expliciete query's om verschillende individuele doelwitten weer te geven, parallel aan een gedeelde representatie voor globale context. Het maakt gebruik van ontkoppelde gemaskeerde aandacht om individuele identiteiten gescheiden te houden van interferentie tussen doelwitten, en spaars geheugen voor stabiele temporele evolutie, samen met gespecialiseerde strategieën voor het omgaan met occlusie en het voorkomen van overlap. SAM-MT ontkoppelt met succes de latentie van het aantal doelwitten, wat een real-time snelheid oplevert die vergelijkbaar is met basislijnen voor enkelvoudige doelwitten (>36 FPS voor 10 doelwitten) terwijl de robuuste videosegmentatieprestaties van SAM2 behouden blijven.
English
Modern Video Object Segmentation (VOS) involves tracking and segmenting user-specified targets. While recent approaches have achieved remarkable performance in single-target scenarios, extending them to multi-target settings typically involves replicating the single-target processing for each individual object, resulting in reduced frame rates (FPS) with unbounded latency as target count increases. Built upon Segment Anything 2 (SAM2), we propose SAM-MT, which addresses this by transforming the model into an interactive framework for real-time Multi-Target video segmentation. SAM-MT uses explicit queries to represent different individual targets, in parallel with a shared representation for global context. It employs decoupled masked attention to keep individual identities distinct from cross-target interference, and sparse memory for stable temporal evolution, along with specialized strategies for occlusion handling and overlap prevention. SAM-MT successfully decouples latency from the number of targets, achieving real-time speed on par with single-target baselines (>36 FPS for 10 targets) while maintaining SAM2's robust video segmentation performance.