ChatPaper.aiChatPaper

Além das Distâncias Escalares: Gradientes de Atributos Semânticos de MLLMs Congelados para Embeddings Visuais

Beyond Scalar Distances: Semantic Attribute Gradients from Frozen MLLMs for Visual Embeddings

June 13, 2026
Autores: Shubhang Bhatnagar, Dheeraj Baiju, Narendra Ahuja
cs.AI

Resumo

Codificadores visuais para recuperação são tipicamente treinados com supervisão de rótulos de classe: cada par de treinamento é reduzido a um escalar que uniformemente afasta ou aproxima as incorporações (embeddings), como se cada atributo visual diferisse ou coincidisse. Um modelo de linguagem multimodal de grande porte (MLLM), ao receber o mesmo par, pode articular esses atributos e usá-los para prever se as imagens compartilham uma classe. Propomos o SAGA, uma estrutura que transforma essa percepção fundamentada na linguagem e consciente de atributos em um sinal de treinamento para o próprio codificador. Especificamente, usamos Otimização de Política Relativa por Grupo (GRPO) para recompensar o MLLM por previsões corretas nos tokens do codificador visual. Como previsões corretas exigem que esses tokens exponham os atributos específicos que diferem ou coincidem entre o par, o gradiente impulsiona o codificador a codificá-los, substituindo o escalar uniforme no nível do par por supervisão resolvida por atributo. Uma perda auxiliar de destilação de atenção ancora a incorporação do codificador aos tokens aos quais o MLLM atendeu, e uma perda padrão de aprendizado de métricas molda a geometria da incorporação para recuperação por vizinho mais próximo. O MLLM é mantido congelado durante todo o processo e descartado na inferência, igualando o custo de implantação de uma baseline de aprendizado de métricas. O SAGA melhora o Recall@1 em 3 a 6 pontos em relação às baselines de última geração nos conjuntos CUB-200-2011, Cars-196, FGVC-Aircraft e iNaturalist Aves na recuperação de imagens zero-shot.
English
Vision encoders for retrieval are typically trained with class-label supervision: each training pair reduces to a scalar that uniformly pushes the embedding apart or pulls it together, as if every visual attribute either differed or matched. A multimodal large language model (MLLM), shown the same pair, can articulate those attributes and use them to predict whether the images share a class. We propose SAGA, a framework that turns this language-grounded, attribute-aware perception into a training signal for the encoder itself. Specifically, we use Group Relative Policy Optimization (GRPO) to reward the MLLM for correct predictions on the vision encoder's tokens. Since correct predictions require those tokens to expose the specific attributes that differ or match between the pair, the gradient pushes the encoder to encode them, replacing the uniform pair-level scalar with attribute-resolved supervision. An auxiliary attention-distillation loss anchors the encoder's embedding to tokens the MLLM attended to, and a standard metric-learning loss shapes the embedding geometry for nearest-neighbour retrieval. The MLLM is frozen throughout and discarded at inference, matching the deployment cost of a metric-learning baseline. SAGA improves Recall@1 by 3 to 6 points over state-of-the-art baselines on CUB-200-2011, Cars-196, FGVC-Aircraft, and iNaturalist Aves on zero-shot image retrieval.