ChatPaper.aiChatPaper

jina-embeddings-v5-omni: Embeddings Multimodais com Preservação da Geometria do Texto via Composição de Torre Congelada

jina-embeddings-v5-omni: Text-Geometry-Preserving Multimodal Embeddings via Frozen-Tower Composition

May 8, 2026
Autores: Florian Hönicke, Michael Günther, Andreas Koukounas, Kalim Akram, Scott Martens, Saba Sturua, Han Xiao
cs.AI

Resumo

Neste trabalho, apresentamos a composição de modelos de codificador congelado, uma abordagem inovadora para modelos de incorporação multimodal. Baseamo-nos na arquitetura do tipo VLM, na qual codificadores não textuais são adaptados para produzir entrada para um modelo de linguagem, que por sua vez gera incorporações para todos os tipos de entrada. Apresentamos o resultado: o conjunto jina-embeddings-v5-omni, um par de modelos que codificam entradas de texto, imagem, áudio e vídeo em um único espaço semântico de incorporação. Nosso método é estender os dois modelos de Texto Jina Embeddings v5 para suportar mídias adicionais, adicionando codificadores para imagens e áudio. Os modelos de incorporação de texto de base e os codificadores de mídia não textual adicionados permanecem congelados. Treinamos apenas os componentes de conexão, que representam 0,35% do total de pesos do modelo conjunto. O treinamento é, portanto, muito mais eficiente do que o retreinamento completo dos parâmetros. Além disso, o modelo de linguagem permanece praticamente inalterado, produzindo exatamente as mesmas incorporações para entradas de texto que os modelos de Texto Jina Embeddings v5. Nossas avaliações mostram que essa abordagem produz resultados competitivos com o estado da arte, com desempenho quase igual ao de modelos maiores de incorporação multimodal.
English
In this work, we introduce frozen-encoder model composition, a novel approach to multimodal embedding models. We build on the VLM-style architecture, in which non-text encoders are adapted to produce input for a language model, which in turn generates embeddings for all varieties of input. We present the result: the jina-embeddings-v5-omni suite, a pair of models that encode text, image, audio, and video input into a single semantic embedding space. Our method is to extend the two Jina Embeddings v5 Text models to support additional media by adding encoders for images and audio. The backbone text embedding models and the added non-text media encoders remain frozen. We only trained the connecting components, representing 0.35% of the total weights of the joint model. Training is therefore much more efficient than full-parameter retraining. Additionally, the language model remains effectively unaltered, producing exactly the same embeddings for text inputs as the Jina Embeddings v5 Text models. Our evaluations show that this approach produces results that are competitive with the state-of-the-art, yielding nearly equal performance to larger multimodal embedding models.