jina-embeddings-v5-omni: Multimodale embeddings met behoud van tekstgeometrie via bevroren-torencompositie
jina-embeddings-v5-omni: Text-Geometry-Preserving Multimodal Embeddings via Frozen-Tower Composition
May 8, 2026
Auteurs: Florian Hönicke, Michael Günther, Andreas Koukounas, Kalim Akram, Scott Martens, Saba Sturua, Han Xiao
cs.AI
Samenvatting
In dit werk introduceren we modelcompositie met bevroren encoders, een nieuwe benadering voor multimodale inbeddingsmodellen. We bouwen voort op de VLM-stijlarchitectuur, waarbij niet-tekstencoders worden aangepast om invoer te produceren voor een taalmodel, dat op zijn beurt inbeddingen genereert voor alle soorten invoer. We presenteren het resultaat: de jina-embeddings-v5-omni-suite, een paar modellen die tekst-, beeld-, audio- en video-invoer coderen in één enkele semantische inbeddingsruimte. Onze methode bestaat uit het uitbreiden van de twee Jina Embeddings v5-tekstmodellen om extra media te ondersteunen door encoders voor afbeeldingen en audio toe te voegen. De backbone-tekstinbeddingsmodellen en de toegevoegde niet-tekstmedia-encoders blijven bevroren. We trainden alleen de verbindende componenten, die 0,35% van de totale gewichten van het gezamenlijke model vertegenwoordigen. Training is daardoor veel efficiënter dan hertraining van alle parameters. Bovendien blijft het taalmodel effectief ongewijzigd, waardoor het exact dezelfde inbeddingen voor tekstinvoer produceert als de Jina Embeddings v5-tekstmodellen. Onze evaluaties tonen aan dat deze aanpak resultaten oplevert die concurrerend zijn met de state-of-the-art, met bijna gelijke prestaties als grotere multimodale inbeddingsmodellen.
English
In this work, we introduce frozen-encoder model composition, a novel approach to multimodal embedding models. We build on the VLM-style architecture, in which non-text encoders are adapted to produce input for a language model, which in turn generates embeddings for all varieties of input. We present the result: the jina-embeddings-v5-omni suite, a pair of models that encode text, image, audio, and video input into a single semantic embedding space. Our method is to extend the two Jina Embeddings v5 Text models to support additional media by adding encoders for images and audio. The backbone text embedding models and the added non-text media encoders remain frozen. We only trained the connecting components, representing 0.35% of the total weights of the joint model. Training is therefore much more efficient than full-parameter retraining. Additionally, the language model remains effectively unaltered, producing exactly the same embeddings for text inputs as the Jina Embeddings v5 Text models. Our evaluations show that this approach produces results that are competitive with the state-of-the-art, yielding nearly equal performance to larger multimodal embedding models.