ChatPaper.aiChatPaper

Alinhamento Anisotrópico de Modalidades

Anisotropic Modality Align

May 8, 2026
Autores: Xiaomin Yu, Yijiang Li, Yuhui Zhang, Hanzhen Zhao, Yue Yang, Hao Tang, Yue Song, Xiaobin Hu, Chengwei Qin, Shuicheng Yan, Hui Xiong
cs.AI

Resumo

O treinamento de modelos de linguagem de grande escala multimodais tem sido historicamente limitado pela escassez de dados multimodais pareados de alta qualidade. Estudos recentes demonstram que o espaço de representação compartilhado de modelos contrastivos multimodais pré-treinados pode servir como uma ponte, permitindo que modelos realizem treinamento multimodal com dados unimodais. No entanto, a premissa central desse paradigma ainda é insuficientemente compreendida: as representações de diferentes modalidades podem ser intercambiáveis de forma confiável? O principal obstáculo reside na persistente Lacuna de Modalidade no espaço compartilhado. Neste trabalho, revisitamos a natureza geométrica da lacuna de modalidade. Descobrimos que as representações das modalidades já compartilham uma geometria semântica dominante compatível. O que realmente dificulta a intercambialidade modal não é um simples deslocamento global, mas uma estrutura residual anisotrópica concentrada ao longo de um pequeno número de direções dominantes. Com base nessa descoberta, propomos ainda o princípio do alinhamento anisotrópico da lacuna de modalidade: um alinhamento modal eficaz deve alinhar-se com a distribuição da modalidade alvo, preservando a estrutura semântica da modalidade fonte. Guiados por esse princípio, propomos um quadro de correção geométrica anisotrópica, denominado AnisoAlign, para o alinhamento de modalidades não pareadas. Esse quadro aproveita o prior geométrico interno da modalidade alvo e realiza correção limitada nas representações da modalidade fonte, construindo assim representações substitutas na modalidade alvo. Experimentos confirmam seus benefícios tanto no diagnóstico geométrico quanto no treinamento de MLLMs baseados apenas em texto. De modo geral, este trabalho reformula a lacuna de modalidade, de uma observação empírica para um fenômeno geométrico estruturado e corrigível, e oferece uma nova perspectiva de alinhamento de representações para o treinamento de modelos multimodais com dados unimodais.
English
Training multimodal large language models has long been limited by the scarcity of high-quality paired multimodal data. Recent studies show that the shared representation space of pretrained multimodal contrastive models can serve as a bridge, enabling models to perform multimodal training with unimodal data. However, the key premise of this paradigm remains insufficiently understood: can representations from different modalities be reliably interchanged? The core obstacle lies in the persistent Modality Gap in the shared space. In this work, we revisit the geometric nature of the modality gap. We find that modality representations already share compatible dominant semantic geometry. What truly hinders modality interchangeability is not a simple global shift, but an anisotropic residual structure concentrated along a small number of dominant directions. Based on this finding, we further propose the principle of anisotropic modality gap alignment: effective modality alignment should align with the target-modality distribution while preserving the semantic structure of the source modality. Guided by this principle, we propose an anisotropic geometric correction framework, AnisoAlign, for unpaired modality alignment. This framework leverages the internal geometric prior of the target modality and performs bounded correction on source-modality representations, thereby constructing substitute representations in the target modality. Experiments confirm its benefits in both geometric diagnostics and text-only MLLM training. Overall, this work recasts the modality gap from an empirical observation into a correctable, structured geometric phenomenon and provides a new representation alignment perspective for training multimodal models with unimodal data.