ChatPaper.aiChatPaper

SiamJEPA: Over de rol van Siamese student-encoders in JEPA

SiamJEPA: On the Role of Siamese Student Encoders in JEPA

July 4, 2026
Auteurs: Makoto Yamada
cs.AI

Samenvatting

Recentelijk hebben Joint Embedding Predictive Architectures (JEPAs) aanzienlijke aandacht gekregen in de computer vision- en machine learning-gemeenschappen als een veelbelovend raamwerk voor zelfgecontroleerd representatieleren. In tegenstelling tot gemaskeerde auto-encoders die pixels reconstrueren, leren JEPA-modellen representaties door latente embeddings van gemaskeerde regio's te voorspellen. Bestaande op JEPA gebaseerde methoden, zoals I-JEPA en V-JEPA, maken doorgaans gebruik van een enkele encoder in het studentennetwerk. Daarentegen is het gebruik van Siamese encoders voor het studentennetwerk meer natuurlijk afgestemd op brein-geïnspireerde raamwerken voor representatieleren, maar hun rol in JEPA-modellen blijft grotendeels onontgonnen. In dit artikel onderzoeken we het effect van Siamese studentencoders in op JEPA gebaseerd representatieleren. Daartoe stellen we SiamJEPA voor, gemaskeerde Siamese studentencoders uitgerust met een exponentieel voortschrijdend gemiddelde (EMA) teacher-netwerk. SiamJEPA kan ook worden gezien als een JEPA-formulering van het brein-geïnspireerde representatieleermodel PhiNet. Door middel van uitgebreide experimenten met ImageNet lineaire probing tonen we aan dat Siamese encoders fungeren als een effectieve regularisator voor de JEPA-doelstelling, waardoor de scheidbaarheid van representaties verbetert en het leren wordt versneld tijdens de vroege stadia van training. Bovendien presteert SiamJEPA consistent beter dan vergelijkbare varianten met enkele encoder onder beperkte trainingsbudgetten en behaalt het een hogere nauwkeurigheid bij lineaire probing dan Masked Autoencoders (MAE), die langere training vereisen. Onze bevindingen laten zien dat Siamese studentencoders niet louter een architectonische keuze zijn, maar een belangrijke inductieve bias vormen voor predictief representatieleren. Deze resultaten bieden nieuwe inzichten in het ontwerp van op JEPA gebaseerde modellen en suggereren dat het opnemen van Siamese studentarchitecturen een eenvoudige maar effectieve benadering biedt voor het verbeteren van zelfgecontroleerd representatieleren.
English
Recently, Joint Embedding Predictive Architectures (JEPAs) have attracted significant attention in the computer vision and machine learning communities as a promising framework for self-supervised representation learning. Unlike masked autoencoders that reconstruct pixels, JEPA models learn representations by predicting latent embeddings of masked regions. Existing JEPA-based methods, such as I-JEPA and V-JEPA, typically employ a single encoder in the student network. In contrast, using Siamese encoders for student network is more naturally aligned with brain-inspired representation learning frameworks, yet their role in JEPA models remains largely unexplored. In this paper, we investigate the effect of Siamese student encoders in JEPA-based representation learning. To this end, we propose SiamJEPA, masked Siamese student encoders equipped with an exponential moving average (EMA) teacher network. SiamJEPA can also be viewed as a JEPA formulation of the brain-inspired representation learning model PhiNet. Through extensive experiments on ImageNet linear probing, we demonstrate that Siamese encoders act as an effective regularizer for the JEPA objective, improving representation separability and accelerating learning during the early stages of training. Furthermore, SiamJEPA consistently outperforms comparable single-encoder JEPA variants under limited training budgets and achieves higher linear probing accuracy than Masked Autoencoders (MAE) which requires longer training. Our findings reveal that Siamese student encoders are not merely an architectural choice but constitute an important inductive bias for predictive representation learning. These results provide new insights into the design of JEPA-based models and suggest that incorporating Siamese student architectures offers a simple yet effective approach for improving self-supervised representation learning.