ChatPaper.aiChatPaper

TIPSv2 : Faire progresser le pré-entraînement vision-langue grâce à un alignement patch-texte amélioré

TIPSv2: Advancing Vision-Language Pretraining with Enhanced Patch-Text Alignment

April 13, 2026
Auteurs: Bingyi Cao, Koert Chen, Kevis-Kokitsi Maninis, Kaifeng Chen, Arjun Karpur, Ye Xia, Sahil Dua, Tanmaya Dabral, Guangxing Han, Bohyung Han, Joshua Ainslie, Alex Bewley, Mithun Jacob, René Wagner, Washington Ramos, Krzysztof Choromanski, Mojtaba Seyedhosseini, Howard Zhou, André Araujo
cs.AI

Résumé

Les progrès récents en prétraitement vision-langage ont permis des améliorations significatives pour de nombreuses applications de vision par ordinateur en aval, telles que la classification, la recherche, la segmentation et la prédiction de profondeur. Cependant, une capacité fondamentale avec laquelle ces modèles peinent encore est l'alignement des représentations denses de patches avec les embeddings textuels des concepts correspondants. Dans ce travail, nous étudions cette problématique critique et proposons de nouvelles techniques pour renforcer cette capacité dans les modèles fondamentaux vision-langage. Premièrement, nous révélons qu'une procédure de distillation au niveau des patches améliore significativement l'alignement patch-texte dense — de façon surprenante, l'alignement patch-texte du modèle étudiant distillé dépasse largement celui du modèle enseignant. Cette observation nous incite à envisager des modifications des méthodes de prétraitement, ce qui nous conduit à proposer iBOT++, une amélioration de l'objectif masqué iBOT couramment utilisé, où les tokens non masqués contribuent également directement à la fonction de perte. Cela améliore considérablement l'alignement patch-texte des modèles prétraités. De plus, pour améliorer l'efficacité et l'efficience du prétraitement vision-langage, nous modifions la configuration de la moyenne mobile exponentielle dans la méthode d'apprentissage, et introduisons une stratégie d'échantillonnage de légendes pour tirer parti des légendes synthétiques à différentes granularités. En combinant ces composants, nous développons TIPSv2, une nouvelle famille de modèles encodeurs image-texte adaptés à un large éventail d'applications en aval. À travers des expériences exhaustives sur 9 tâches et 20 jeux de données, nous démontrons des performances solides, généralement équivalentes ou supérieures aux modèles encodeurs vision récents. Le code et les modèles sont publiés via notre page projet à l'adresse https://gdm-tipsv2.github.io/.
English
Recent progress in vision-language pretraining has enabled significant improvements to many downstream computer vision applications, such as classification, retrieval, segmentation and depth prediction. However, a fundamental capability that these models still struggle with is aligning dense patch representations with text embeddings of corresponding concepts. In this work, we investigate this critical issue and propose novel techniques to enhance this capability in foundational vision-language models. First, we reveal that a patch-level distillation procedure significantly boosts dense patch-text alignment -- surprisingly, the patch-text alignment of the distilled student model strongly surpasses that of the teacher model. This observation inspires us to consider modifications to pretraining recipes, leading us to propose iBOT++, an upgrade to the commonly-used iBOT masked image objective, where unmasked tokens also contribute directly to the loss. This dramatically enhances patch-text alignment of pretrained models. Additionally, to improve vision-language pretraining efficiency and effectiveness, we modify the exponential moving average setup in the learning recipe, and introduce a caption sampling strategy to benefit from synthetic captions at different granularities. Combining these components, we develop TIPSv2, a new family of image-text encoder models suitable for a wide range of downstream applications. Through comprehensive experiments on 9 tasks and 20 datasets, we demonstrate strong performance, generally on par with or better than recent vision encoder models. Code and models are released via our project page at https://gdm-tipsv2.github.io/ .