ChatPaper.aiChatPaper

Alinhamento Hiperbólico Consciente de Ranque para Destilação de Conjunto de Dados Visão-Linguagem

Rank-Aware Hyperbolic Alignment for Vision-Language Dataset Distillation

June 28, 2026
Autores: Jongoh Jeong, Sun-Kyung Lee, Kuk-Jin Yoon
cs.AI

Resumo

A destilação de conjuntos de dados visão-linguagem (VLDD) comprime um grande conjunto de pares imagem-texto em um pequeno conjunto de pares sintéticos capazes de treinar eficientemente modelos contrastivos visão-linguagem sob orçamentos restritos de dados e computação. A maioria dos métodos existentes corresponde a trajetórias de especialistas ou estatísticas entre modalidades, mas ainda impõem alinhamento completo de dimensionalidade em um espaço de incorporação euclidiano. Isso é frequentemente excessivamente restritivo devido à correlação imagem-texto com posto deficiente, com semântica compartilhada concentrada em um intervalo de baixa dimensionalidade e variação remanescente espalhada por um subespaço residual fracamente correlacionado. O LoRS relaxa o alinhamento no nível de similaridade por meio da fatoração de posto baixo, mas não controla explicitamente a capacidade e estrutura de alinhamento dominante no espaço de representação. Propomos, portanto, um alinhamento hiperbólico consciente de posto (RAHA) que combina geometria hierárquica com controle explícito de capacidade de alinhamento. O RAHA eleva representações multimodais ao espaço hiperbólico e otimiza pares destilados com objetivos assimétricos que impõem alinhamento geodésico no intervalo compartilhado, enquanto regulariza o subespaço residual para preservar a diversidade privada da modalidade e melhorar a robustez de transferência. Experimentos em benchmarks mostram que o RAHA demonstra recuperação entre modalidades competitiva e indicadores de transferência melhorados sob orçamentos fixos.
English
Vision-language dataset distillation (VLDD) compresses a large image-text paired dataset into a small set of synthetic pairs that can efficiently train contrastive vision-language models under strict data and compute budgets. Most existing methods match expert trajectories or cross-modal statistics, yet still enforce full-dimensional alignment in a Euclidean embedding space. This is often overly restrictive due to rank-deficient image--text correlation, with shared semantics concentrated in a low-dimensional range and remaining variation spread across a weakly correlated residual subspace. LoRS relaxes alignment at the similarity level by low-rank factorization, but does not explicitly control dominant alignment capacity and structure in the representation space. We thus propose a rank-aware hyperbolic alignment (RAHA) that combines hierarchical geometry with explicit alignment-capacity control. RAHA lifts multimodal representations to hyperbolic space and optimizes distilled pairs with asymmetric objectives that enforce geodesic alignment in the shared range while regularizing the residual subspace to preserve modality-private diversity and improve transfer robustness. Experiments on benchmarks show that RAHA demonstrates competitive cross-modal retrieval and improved transfer indicators under fixed budgets.