SiamJEPA : Sur le rôle des encodeurs étudiants siamois dans JEPA
SiamJEPA: On the Role of Siamese Student Encoders in JEPA
July 4, 2026
Auteurs: Makoto Yamada
cs.AI
Résumé
Récemment, les Architectures Prédictives par Plongement Conjoint (JEPA) ont suscité un intérêt considérable dans les communautés de la vision par ordinateur et de l'apprentissage automatique en tant que cadre prometteur pour l'apprentissage de représentations auto-supervisé. Contrairement aux autoencodeurs masqués qui reconstruisent les pixels, les modèles JEPA apprennent des représentations en prédisant les plongements latents des régions masquées. Les méthodes existantes basées sur JEPA, telles que I-JEPA et V-JEPA, utilisent généralement un seul encodeur dans le réseau étudiant. En revanche, l'utilisation d'encodeurs siamois pour le réseau étudiant est plus naturellement alignée avec les cadres d'apprentissage de représentations inspirés du cerveau, mais leur rôle dans les modèles JEPA reste largement inexploré. Dans cet article, nous étudions l'effet des encodeurs étudiants siamois dans l'apprentissage de représentations basé sur JEPA. À cette fin, nous proposons SiamJEPA, des encodeurs étudiants siamois masqués équipés d'un réseau professeur à moyenne mobile exponentielle (EMA). SiamJEPA peut également être vu comme une formulation JEPA du modèle d'apprentissage de représentations inspiré du cerveau PhiNet. Grâce à des expériences approfondies de sondage linéaire sur ImageNet, nous démontrons que les encodeurs siamois agissent comme un régularisateur efficace pour l'objectif JEPA, améliorant la séparabilité des représentations et accélérant l'apprentissage pendant les premières étapes de l'entraînement. De plus, SiamJEPA surpasse systématiquement les variantes JEPA comparables à encodeur unique sous des budgets d'entraînement limités et atteint une précision de sondage linéaire plus élevée que les Autoencodeurs Masqués (MAE) qui nécessitent un entraînement plus long. Nos résultats révèlent que les encodeurs étudiants siamois ne sont pas simplement un choix architectural mais constituent un biais inductif important pour l'apprentissage de représentations prédictif. Ces résultats fournissent de nouvelles perspectives pour la conception de modèles basés sur JEPA et suggèrent que l'incorporation d'architectures étudiantes siamoises offre une approche simple mais efficace pour améliorer l'apprentissage de représentations auto-supervisé.
English
Recently, Joint Embedding Predictive Architectures (JEPAs) have attracted significant attention in the computer vision and machine learning communities as a promising framework for self-supervised representation learning. Unlike masked autoencoders that reconstruct pixels, JEPA models learn representations by predicting latent embeddings of masked regions. Existing JEPA-based methods, such as I-JEPA and V-JEPA, typically employ a single encoder in the student network. In contrast, using Siamese encoders for student network is more naturally aligned with brain-inspired representation learning frameworks, yet their role in JEPA models remains largely unexplored. In this paper, we investigate the effect of Siamese student encoders in JEPA-based representation learning. To this end, we propose SiamJEPA, masked Siamese student encoders equipped with an exponential moving average (EMA) teacher network. SiamJEPA can also be viewed as a JEPA formulation of the brain-inspired representation learning model PhiNet. Through extensive experiments on ImageNet linear probing, we demonstrate that Siamese encoders act as an effective regularizer for the JEPA objective, improving representation separability and accelerating learning during the early stages of training. Furthermore, SiamJEPA consistently outperforms comparable single-encoder JEPA variants under limited training budgets and achieves higher linear probing accuracy than Masked Autoencoders (MAE) which requires longer training. Our findings reveal that Siamese student encoders are not merely an architectural choice but constitute an important inductive bias for predictive representation learning. These results provide new insights into the design of JEPA-based models and suggest that incorporating Siamese student architectures offers a simple yet effective approach for improving self-supervised representation learning.