Sapiens2
Sapiens2
April 23, 2026
Auteurs: Rawal Khirodkar, He Wen, Julieta Martinez, Yuan Dong, Su Zhaoen, Shunsuke Saito
cs.AI
Résumé
Nous présentons Sapiens2, une famille de modèles transformers haute résolution dédiée à la vision centrée sur l'humain, axée sur la généralisation, la polyvalence et la production de résultats haute fidélité. Nos modèles comportent de 0,4 à 5 milliards de paramètres, avec une résolution native de 1K et des variantes hiérarchiques prenant en charge la 4K. Sapiens2 améliore considérablement son prédécesseur, tant en pré-entraînement qu'en post-formation. Premièrement, pour apprendre des caractéristiques captant les détails de bas niveau (pour la prédiction dense) et la sémantique de haut niveau (pour des contextes zero-shot ou à faible étiquetage), nous combinons la reconstruction d'image masquée avec des objectifs contrastifs auto-distillés. Nos évaluations montrent que cet objectif de pré-entraînement unifié est mieux adapté à un plus large éventail de tâches en aval. Deuxièmement, sur l'axe des données, nous effectuons un pré-entraînement sur un jeu de données curé d'un milliard d'images humaines de haute qualité et améliorons la qualité et la quantité des annotations de tâches. Troisièmement, sur le plan architectural, nous intégrons des avancées de modèles de pointe permettant des cycles d'entraînement plus longs avec une stabilité améliorée. Nos modèles 4K adoptent l'attention fenêtrée pour raisonner sur un contexte spatial plus long et sont pré-entraînés avec une résolution de sortie de 2K. Sapiens2 établit un nouvel état de l'art et améliore la première génération sur la pose (+4 mAP), la segmentation des parties du corps (+24,3 mIoU), l'estimation des normales (erreur angulaire réduite de 45,6 %) et s'étend à de nouvelles tâches telles que l'estimation de cartes de points et d'albédo. Code : https://github.com/facebookresearch/sapiens2
English
We present Sapiens2, a model family of high-resolution transformers for human-centric vision focused on generalization, versatility, and high-fidelity outputs. Our model sizes range from 0.4 to 5 billion parameters, with native 1K resolution and hierarchical variants that support 4K. Sapiens2 substantially improves over its predecessor in both pretraining and post-training. First, to learn features that capture low-level details (for dense prediction) and high-level semantics (for zero-shot or few-label settings), we combine masked image reconstruction with self-distilled contrastive objectives. Our evaluations show that this unified pretraining objective is better suited for a wider range of downstream tasks. Second, along the data axis, we pretrain on a curated dataset of 1 billion high-quality human images and improve the quality and quantity of task annotations. Third, architecturally, we incorporate advances from frontier models that enable longer training schedules with improved stability. Our 4K models adopt windowed attention to reason over longer spatial context and are pretrained with 2K output resolution. Sapiens2 sets a new state-of-the-art and improves over the first generation on pose (+4 mAP), body-part segmentation (+24.3 mIoU), normal estimation (45.6% lower angular error) and extends to new tasks such as pointmap and albedo estimation. Code: https://github.com/facebookresearch/sapiens2