jina-embeddings-v5-omni : plongements multimodaux préservant la géométrie textuelle via composition de tours gelées
jina-embeddings-v5-omni: Text-Geometry-Preserving Multimodal Embeddings via Frozen-Tower Composition
May 8, 2026
Auteurs: Florian Hönicke, Michael Günther, Andreas Koukounas, Kalim Akram, Scott Martens, Saba Sturua, Han Xiao
cs.AI
Résumé
Dans ce travail, nous introduisons la composition de modèles à encodeurs gelés, une approche novatrice pour les modèles de plongement multimodaux. Nous nous appuyons sur l'architecture de type VLM, dans laquelle les encodeurs non textuels sont adaptés pour produire des entrées destinées à un modèle de langage, qui génère à son tour des plongements pour toutes les variétés d'entrées. Nous présentons le résultat : la suite jina-embeddings-v5-omni, une paire de modèles qui encodent des entrées textuelles, images, audio et vidéo dans un unique espace de plongement sémantique. Notre méthode consiste à étendre les deux modèles textuels Jina Embeddings v5 pour prendre en charge des médias supplémentaires en ajoutant des encodeurs pour les images et l'audio. Les modèles de plongement textuels de base et les encodeurs non textuels ajoutés restent gelés. Nous n'avons entraîné que les composants de liaison, représentant 0,35 % du poids total du modèle conjoint. L'entraînement est donc bien plus efficace qu'un réentraînement complet des paramètres. De plus, le modèle de langage demeure effectivement inchangé, produisant exactement les mêmes plongements pour les entrées textuelles que les modèles Jina Embeddings v5 Text. Nos évaluations montrent que cette approche donne des résultats compétitifs avec l'état de l'art, avec des performances quasi équivalentes à celles de modèles de plongement multimodaux plus volumineux.
English
In this work, we introduce frozen-encoder model composition, a novel approach to multimodal embedding models. We build on the VLM-style architecture, in which non-text encoders are adapted to produce input for a language model, which in turn generates embeddings for all varieties of input. We present the result: the jina-embeddings-v5-omni suite, a pair of models that encode text, image, audio, and video input into a single semantic embedding space. Our method is to extend the two Jina Embeddings v5 Text models to support additional media by adding encoders for images and audio. The backbone text embedding models and the added non-text media encoders remain frozen. We only trained the connecting components, representing 0.35% of the total weights of the joint model. Training is therefore much more efficient than full-parameter retraining. Additionally, the language model remains effectively unaltered, producing exactly the same embeddings for text inputs as the Jina Embeddings v5 Text models. Our evaluations show that this approach produces results that are competitive with the state-of-the-art, yielding nearly equal performance to larger multimodal embedding models.