ChatPaper.aiChatPaper

SAM2Matting: gegeneraliseerde beeld- en videomatting

SAM2Matting: Generalized Image and Video Matting

June 25, 2026
Auteurs: Ruiqi Shen, Guangquan Jie, Chang Liu, Henghui Ding
cs.AI

Samenvatting

Ondanks indrukwekkende vooruitgang in beeldmatting blijft videomatting uitdagend vanwege de inherente kloof tussen tracking op hoog niveau, dat een begrip per frame vereist, en matting op laag niveau, dat zich richt op extreem fijnkorrelige details. Bestaande methoden proberen dit aan te pakken met dure en beperkt toepasbare videomatting-datasets, wat de generalizatie buiten het domein kan beperken en de robuustheid van tracking kan aantasten. Wij herzien het paradigma met SAM2Matting, een tracker-naar-matting raamwerk dat VOS-trackers opwaardeert naar videomatting met hoge getrouwheid. Specifiek ontkoppelt het de taak door een fundamentele tracker (bijv. SAM2, SAM3) te versterken met een regiovoorstelbrug en speciale matting-koppen, waardoor de compromisloze tracker temporele consistentie kan handhaven terwijl de matting-componenten fijnkorrelige details oplossen. Opmerkelijk is dat SAM2Matting, hoewel alleen getraind op beelden, nieuwe state-of-the-art prestaties levert op videomatting, diverse prompttypen ondersteunt, sterke temporele consistentie behoudt en robuuste generalizatie vertoont in zowel mensgerichte als in-the-wild scenario's.
English
Despite impressive advances in image matting, video matting remains challenging due to the inherent gap between high-level tracking, which requires frame-wise understanding, and low-level matting, which focuses on extremely fine-grained details. Existing methods attempt this with expensive and narrowly-scoped video matting datasets, which may limit out-of-domain generalization and compromise tracking robustness. We rethink the paradigm with SAM2Matting, a tracker-to-matting framework that advances VOS trackers to high-fidelity video matting. Specifically, it decouples the task by enhancing a foundational tracker (e.g., SAM2, SAM3) with a region-proposal bridge and dedicated matting heads, enabling the uncompromised tracker to handle temporal consistency while the matting components resolve fine-grained details. Notably, despite being trained only on images, SAM2Matting establishes new state-of-the-art performance on video matting, supports diverse prompt types, maintains strong temporal consistency, and demonstrates robust generalization across both human-centric and in-the-wild scenarios.