DataComp-VLM: Conjuntos de Dados Abertos Aprimorados para Modelos de Visão e Linguagem
DataComp-VLM: Improved Open Datasets for Vision-Language Models
June 26, 2026
Autores: Matteo Farina, Vishaal Udandarao, Thao Nguyen, Selim Kuzucu, Maximilian Böther, Andreas Hochlehnert, Adhiraj Ghosh, Marianna Nezhurina, Karsten Roth, Joschka Struber, Yuhui Zhang, Sebastian Dziadzio, Elaine Sui, Soumya Jahagirdar, Dhruba Ghosh, Hasan Hammoud, Thomas De Min, Simone Caldarella, Jehanzeb Mirza, Sedrick Keh, Mehdi Cherti, Hilde Kuehne, Bernt Schiele, Serena Yeung-Levy, Muhammad Ferjad Naeem, Federico Tombari, Ana Klimovic, Elisa Ricci, Matthias Bethge, Sewoong Oh, Ameya Prabhu, Alessio Tonioni, Jenia Jitsev, Massimiliano Mancini, Ludwig Schmidt, Nikhil Parthasarathy
cs.AI
Resumo
Construir Modelos de Visão-Linguagem (VLMs) performáticos exige uma curadoria cuidadosa de conjuntos de dados de treino em larga escala, mas a comunidade carece de benchmarks sistemáticos para avaliar tais estratégias de curadoria. Apresentamos o DataComp para VLMs (DCVLM), um benchmark para experimentos controlados centrados em dados com o objetivo de melhorar o treino de VLMs. Como parte do DCVLM, recolhemos 160 conjuntos de dados abrangendo quatro tipos de dados — pares imagem-legenda, documentos multimodais intercalados, apenas texto e dados de ajuste de instrução — num corpus de 6T de tokens multimodais. O DCVLM permite que os participantes testem estratégias de curadoria (filtragem, mistura, formatação, amostragem) em modelos de 1B a 8B e orçamentos de tokens de 6.25B a 200B. Os modelos são então avaliados num conjunto cuidadosamente selecionado de até 52 benchmarks downstream em 9 domínios. Realizamos experiências extensas no DCVLM e concluímos que a mistura de dados, e não a filtragem, é a chave para um conjunto de dados de treino de alta qualidade: misturas com forte presença de instruções escalam melhor do que as com forte presença de legendas, com ganhos que se alargam em escalas maiores. O conjunto de dados resultante, DCVLM-Baseline, permite treinar um VLM de 8B para uma acurácia de 63,6% no nosso conjunto central de 33 tarefas com 200B de tokens de treino. Em comparação com o FineVision, o conjunto de dados de treino VLM aberto de última geração, isto representa uma melhoria de +5,4 p.p. O DCVLM e todos os artefactos que o acompanham serão disponibilizados publicamente em https://www.datacomp.ai/dcvlm/.
English
Building performant Vision-Language Models (VLMs) requires carefully curating large-scale training datasets, yet the community lacks systematic benchmarks for evaluating such curation strategies. We introduce DataComp for VLMs (DCVLM), a benchmark for controlled data-centric experiments to improve VLM training. As part of DCVLM, we collect 160 datasets spanning four data types -- image-caption pairs, multimodal interleaved documents, text-only, and instruction-tuning data -- into a corpus of 6T multimodal tokens. DCVLM allows participants to test curation strategies (filtering, mixing, formatting, sampling) across 1B-8B models and 6.25B-200B token budgets. Models are then evaluated on a carefully selected suite of up to 52 downstream benchmarks across 9 domains. We conduct extensive experiments on DCVLM and find that data mixing, not filtering, is key to a high-quality training dataset: instruction-heavy mixtures scale better than caption-heavy ones, with gains widening at larger scales. The resulting dataset, DCVLM-Baseline, enables training an 8B VLM to 63.6% accuracy on our 33-task core suite with 200B training tokens. Compared to FineVision, the state-of-the-art open VLM training dataset, this represents an improvement of +5.4pp. DCVLM and all accompanying artifacts will be made publicly available at https://www.datacomp.ai/dcvlm/.