ChatPaper.aiChatPaper

SiamJEPA: Sobre el papel de los codificadores estudiantes siameses en JEPA

SiamJEPA: On the Role of Siamese Student Encoders in JEPA

July 4, 2026
Autores: Makoto Yamada
cs.AI

Resumen

Recientemente, las Arquitecturas Predictivas de Embedding Conjunto (JEPAs) han captado una atención significativa en las comunidades de visión por computadora y aprendizaje automático como un marco prometedor para el aprendizaje autosupervisado de representaciones. A diferencia de los autoencoders enmascarados que reconstruyen píxeles, los modelos JEPA aprenden representaciones prediciendo embeddings latentes de regiones enmascaradas. Los métodos basados en JEPA existentes, como I-JEPA y V-JEPA, suelen emplear un único codificador en la red estudiante. Por el contrario, el uso de codificadores siameses para la red estudiante se alinea de forma más natural con marcos de aprendizaje de representaciones inspirados en el cerebro, si bien su papel en los modelos JEPA sigue siendo en gran medida inexplorado. En este artículo, investigamos el efecto de los codificadores estudiantes siameses en el aprendizaje de representaciones basado en JEPA. Para ello, proponemos SiamJEPA, codificadores estudiantes siameses enmascarados equipados con una red profesora de media móvil exponencial (EMA). SiamJEPA también puede verse como una formulación JEPA del modelo de aprendizaje de representaciones inspirado en el cerebro PhiNet. Mediante experimentos exhaustivos con evaluación lineal (linear probing) en ImageNet, demostramos que los codificadores siameses actúan como un regularizador efectivo para el objetivo de JEPA, mejorando la separabilidad de las representaciones y acelerando el aprendizaje durante las etapas tempranas del entrenamiento. Además, SiamJEPA supera consistentemente a variantes comparables de JEPA con un único codificador bajo presupuestos de entrenamiento limitados y logra una mayor precisión en evaluación lineal que los Autoencoders Enmascarados (MAE), que requieren un entrenamiento más prolongado. Nuestros hallazgos revelan que los codificadores estudiantes siameses no son meramente una elección arquitectónica, sino que constituyen un sesgo inductivo importante para el aprendizaje predictivo de representaciones. Estos resultados proporcionan nuevas perspectivas sobre el diseño de modelos basados en JEPA y sugieren que la incorporación de arquitecturas estudiantes siamesas ofrece un enfoque simple pero efectivo para mejorar el aprendizaje autosupervisado de representaciones.
English
Recently, Joint Embedding Predictive Architectures (JEPAs) have attracted significant attention in the computer vision and machine learning communities as a promising framework for self-supervised representation learning. Unlike masked autoencoders that reconstruct pixels, JEPA models learn representations by predicting latent embeddings of masked regions. Existing JEPA-based methods, such as I-JEPA and V-JEPA, typically employ a single encoder in the student network. In contrast, using Siamese encoders for student network is more naturally aligned with brain-inspired representation learning frameworks, yet their role in JEPA models remains largely unexplored. In this paper, we investigate the effect of Siamese student encoders in JEPA-based representation learning. To this end, we propose SiamJEPA, masked Siamese student encoders equipped with an exponential moving average (EMA) teacher network. SiamJEPA can also be viewed as a JEPA formulation of the brain-inspired representation learning model PhiNet. Through extensive experiments on ImageNet linear probing, we demonstrate that Siamese encoders act as an effective regularizer for the JEPA objective, improving representation separability and accelerating learning during the early stages of training. Furthermore, SiamJEPA consistently outperforms comparable single-encoder JEPA variants under limited training budgets and achieves higher linear probing accuracy than Masked Autoencoders (MAE) which requires longer training. Our findings reveal that Siamese student encoders are not merely an architectural choice but constitute an important inductive bias for predictive representation learning. These results provide new insights into the design of JEPA-based models and suggest that incorporating Siamese student architectures offers a simple yet effective approach for improving self-supervised representation learning.