ZooClaw-FashionSigLIP2: Ajuste Fino Destilado para Recuperação Robusta de Moda
ZooClaw-FashionSigLIP2: Distilled Fine-tuning for Robust Fashion Retrieval
June 26, 2026
Autores: Siqiao Xue, Chunxue Xu
cs.AI
Resumo
Adaptar um codificador de visão-linguagem fundamental a uma tarefa especializada de recuperação cria uma troca fundamental: ganhos na distribuição alvo ocorrem às custas da ampla generalização do modelo fundamental, e a recuperação de moda é um caso rigoroso desse problema. Apresentamos o ZooClaw-FashionSigLIP2, um modelo SigLIP2-base especializado em moda que resolve essa troca com uma receita simples — ajuste fino completo com destilação de conhecimento em dados internos curados, seguido de interpolação de pesos \wiseft~wortsman2022wiseft com o modelo base — e supera LoRA, backbones maiores (até 1 bilhão de parâmetros) e dados de treinamento externos. Sob avaliação justa, o ZooClaw-FashionSigLIP2 supera todas as linhas de base em todos os benchmarks do nosso conjunto. Além disso, disponibilizamos o ZooClaw-Fashion, um novo benchmark de recuperação de moda de alta qualidade, e uma análise sistemática da qualidade de benchmarks amplamente utilizados, que expõe e mitiga vieses estruturais em seus ground truths públicos. Disponibilizamos em código aberto os pesos do modelo e todos os artefatos de avaliação para facilitar pesquisas futuras.
English
Adapting a foundation vision-language encoder to a specialized retrieval task creates a fundamental tradeoff: gains on the target distribution come at the cost of the foundation model's broad generalization, and fashion retrieval is a stringent instance of this problem. We present ZooClaw-FashionSigLIP2, a fashion-specialized SigLIP2-base model that resolves this tradeoff with a simple recipe -- full fine-tuning with knowledge distillation on curated in-domain data, followed by \wiseft~wortsman2022wiseft weight interpolation with the base model -- and outperforms LoRA, larger backbones (up to 1B parameters), and external training data. Under fair evaluation, ZooClaw-FashionSigLIP2 outperforms all baselines on every benchmark in our suite. In addition, we release ZooClaw-Fashion, a new high-quality fashion retrieval benchmark, and a systematic quality analysis of widely-used benchmarks that exposes and mitigates structural biases in their public ground truth. We open-source the model weights and all evaluation artifacts to facilitate future research.