ChatPaper.aiChatPaper

ModelLens: Encontrando o Melhor para Sua Tarefa entre Miríades de Modelos

ModelLens: Finding the Best for Your Task from Myriads of Models

May 8, 2026
Autores: Rui Cai, Weijie Jacky Mo, Xiaofei Wen, Qiyao Ma, Wenhui Zhu, Xiwen Chen, Muhao Chen, Zhe Zhao
cs.AI

Resumo

O ecossistema de modelos de código aberto agora contém centenas de milhares de modelos pré-treinados, porém selecionar o melhor modelo para um novo dataset torna-se cada vez mais inviável: novos modelos e datasets não avaliados surgem continuamente, deixando os profissionais sem registros prévios de ambos os lados. Abordagens existentes lidam apenas com fragmentos desse cenário em condições reais: AutoML e estimativa de transferibilidade selecionam modelos a partir de pequenos conjuntos predefinidos ou exigem passagens diretas por modelo caras no dataset alvo, enquanto o roteamento de modelos pressupõe um pool de candidatos fornecido. Apresentamos o ModelLens, uma estrutura unificada para recomendação de modelos em condições reais. Nosso principal insight é que as interações em leaderboards públicos, embora dispersas e ruidosas, traçam coletivamente um atlas implícito das capacidades dos modelos em configurações de avaliação heterogêneas, um sinal rico o suficiente para aprender diretamente. Ao aprender um espaço latente ciente de desempenho sobre tuplas modelo–dataset–métrica, o ModelLens classifica modelos não vistos em datasets não vistos sem executar candidatos no dataset alvo. Em um novo benchmark com 1,62 milhão de registros de avaliação abrangendo 47 mil modelos e 9,6 mil datasets, o ModelLens supera linhas de base que dependem apenas de metadados ou exigem a execução de cada candidato no dataset alvo. Seus pools Top-K recomendados melhoram ainda mais vários métodos representativos de roteamento em até 81% em diversos benchmarks de QA. Estudos de caso em benchmarks lançados recentemente confirmam ainda a generalização para tarefas de texto e visão-linguagem.
English
The open-source model ecosystem now contains hundreds of thousands of pretrained models, yet picking the best model for a new dataset is increasingly infeasible: new models and unbenchmarked datasets emerge continuously, leaving practitioners with no prior records on either side. Existing approaches handle only fragments of this in-the-wild setting: AutoML and transferability estimation select models from small predefined pools or require expensive per-model forward passes on the target dataset, while model routing presupposes a given candidate pool. We introduce ModelLens, a unified framework for model recommendation in the wild. Our key insight is that public leaderboard interactions, though scattered and noisy, collectively trace out an implicit atlas of model capabilities across heterogeneous evaluation settings, a signal rich enough to learn from directly. By learning a performance-aware latent space over model--dataset--metric tuples, ModelLens ranks unseen models on unseen datasets without running candidates on the target dataset. On a new benchmark of 1.62M evaluation records spanning 47K models and 9.6K datasets, ModelLens surpasses baselines that either rely on metadata alone or require running each candidate on the target dataset. Its recommended Top-K pools further improve multiple representative routing methods by up to 81% across diverse QA benchmarks. Case studies on recently released benchmarks further confirm generalization to both text and vision-language tasks.