ChatPaper.aiChatPaper

SAM2Matting: Matting Generalizado de Imagens e Vídeos

SAM2Matting: Generalized Image and Video Matting

June 25, 2026
Autores: Ruiqi Shen, Guangquan Jie, Chang Liu, Henghui Ding
cs.AI

Resumo

Apesar dos avanços impressionantes em matting de imagem, o matting de vídeo continua sendo desafiador devido à lacuna inerente entre o rastreamento de alto nível, que requer compreensão quadro a quadro, e o matting de baixo nível, que foca em detalhes extremamente finos. Os métodos existentes tentam isso com conjuntos de dados de matting de vídeo caros e de escopo restrito, o que pode limitar a generalização fora do domínio e comprometer a robustez do rastreamento. Repensamos o paradigma com o SAM2Matting, uma estrutura de rastreador para matting que avança os rastreadores VOS para matting de vídeo de alta fidelidade. Especificamente, ele desacopla a tarefa ao aprimorar um rastreador fundamental (por exemplo, SAM2, SAM3) com uma ponte de proposta de região e cabeças de matting dedicadas, permitindo que o rastreador não comprometido lide com a consistência temporal enquanto os componentes de matting resolvem detalhes finos. Notavelmente, apesar de ser treinado apenas em imagens, o SAM2Matting estabelece um novo desempenho de estado da arte em matting de vídeo, suporta diversos tipos de prompt, mantém forte consistência temporal e demonstra generalização robusta tanto em cenários centrados em humanos quanto em cenários in-the-wild.
English
Despite impressive advances in image matting, video matting remains challenging due to the inherent gap between high-level tracking, which requires frame-wise understanding, and low-level matting, which focuses on extremely fine-grained details. Existing methods attempt this with expensive and narrowly-scoped video matting datasets, which may limit out-of-domain generalization and compromise tracking robustness. We rethink the paradigm with SAM2Matting, a tracker-to-matting framework that advances VOS trackers to high-fidelity video matting. Specifically, it decouples the task by enhancing a foundational tracker (e.g., SAM2, SAM3) with a region-proposal bridge and dedicated matting heads, enabling the uncompromised tracker to handle temporal consistency while the matting components resolve fine-grained details. Notably, despite being trained only on images, SAM2Matting establishes new state-of-the-art performance on video matting, supports diverse prompt types, maintains strong temporal consistency, and demonstrates robust generalization across both human-centric and in-the-wild scenarios.