Rangbewuste Hyperbolische Uitlijning voor Visie-Taal Datasetdistillatie
Rank-Aware Hyperbolic Alignment for Vision-Language Dataset Distillation
June 28, 2026
Auteurs: Jongoh Jeong, Sun-Kyung Lee, Kuk-Jin Yoon
cs.AI
Samenvatting
Visie-taal dataset distillatie (VLDD) comprimeert een grote dataset van beeld-tekst paren tot een kleine set synthetische paren die efficiënt contrastieve visie-taal modellen kunnen trainen onder strikte data- en rekenbudgetten. De meeste bestaande methoden matchen expert trajecten of cross-modale statistieken, maar dwingen nog steeds een volledige dimensionale afstemming af in een Euclidische inbeddingsruimte. Dit is vaak te restrictief vanwege rang-deficiënte beeld-tekst correlatie, waarbij gedeelde semantiek geconcentreerd is in een laagdimensionaal bereik en overige variatie verspreid is over een zwak gecorreleerde residuele deelruimte. LoRS versoepelt afstemming op gelijkenisniveau door lage-rang factorisatie, maar controleert niet expliciet de dominante afstemmingscapaciteit en -structuur in de representatieruimte. Daarom stellen we een rangbewuste hyperbolische afstemming (RAHA) voor die hiërarchische geometrie combineert met expliciete controle van de afstemmingscapaciteit. RAHA tilt multimodale representaties naar de hyperbolische ruimte en optimaliseert gedistilleerde paren met asymmetrische doelstellingen die geodetische afstemming in het gedeelde bereik afdwingen, terwijl de residuele deelruimte wordt geregulariseerd om modaliteits-private diversiteit te behouden en overdrachtsrobuustheid te verbeteren. Experimenten op benchmarks tonen aan dat RAHA competitieve cross-modale terugwinning en verbeterde overdrachtsindicatoren levert onder vaste budgetten.
English
Vision-language dataset distillation (VLDD) compresses a large image-text paired dataset into a small set of synthetic pairs that can efficiently train contrastive vision-language models under strict data and compute budgets. Most existing methods match expert trajectories or cross-modal statistics, yet still enforce full-dimensional alignment in a Euclidean embedding space. This is often overly restrictive due to rank-deficient image--text correlation, with shared semantics concentrated in a low-dimensional range and remaining variation spread across a weakly correlated residual subspace. LoRS relaxes alignment at the similarity level by low-rank factorization, but does not explicitly control dominant alignment capacity and structure in the representation space. We thus propose a rank-aware hyperbolic alignment (RAHA) that combines hierarchical geometry with explicit alignment-capacity control. RAHA lifts multimodal representations to hyperbolic space and optimizes distilled pairs with asymmetric objectives that enforce geodesic alignment in the shared range while regularizing the residual subspace to preserve modality-private diversity and improve transfer robustness. Experiments on benchmarks show that RAHA demonstrates competitive cross-modal retrieval and improved transfer indicators under fixed budgets.