ChatPaper.aiChatPaper

DataComp-VLM: Verbeterde open datasets voor visie-taalmodellen

DataComp-VLM: Improved Open Datasets for Vision-Language Models

June 26, 2026
Auteurs: Matteo Farina, Vishaal Udandarao, Thao Nguyen, Selim Kuzucu, Maximilian Böther, Andreas Hochlehnert, Adhiraj Ghosh, Marianna Nezhurina, Karsten Roth, Joschka Struber, Yuhui Zhang, Sebastian Dziadzio, Elaine Sui, Soumya Jahagirdar, Dhruba Ghosh, Hasan Hammoud, Thomas De Min, Simone Caldarella, Jehanzeb Mirza, Sedrick Keh, Mehdi Cherti, Hilde Kuehne, Bernt Schiele, Serena Yeung-Levy, Muhammad Ferjad Naeem, Federico Tombari, Ana Klimovic, Elisa Ricci, Matthias Bethge, Sewoong Oh, Ameya Prabhu, Alessio Tonioni, Jenia Jitsev, Massimiliano Mancini, Ludwig Schmidt, Nikhil Parthasarathy
cs.AI

Samenvatting

Het bouwen van performante visie-taalmodelen (VLMs) vereist het zorgvuldig samenstellen van grootschalige trainingsdatasets, maar de gemeenschap mist systematische benchmarks om dergelijke curatiestrategieën te evalueren. Wij introduceren DataComp voor VLMs (DCVLM), een benchmark voor gecontroleerde data-gerichte experimenten om VLM-training te verbeteren. Als onderdeel van DCVLM verzamelen we 160 datasets die vier datatypes omvatten – beeld-onderschriftparen, multimodale afgewisselde documenten, alleen-tekst, en instructie-afstemmingsgegevens – tot een corpus van 6T multimodale tokens. DCVLM stelt deelnemers in staat om curatiestrategieën te testen (filteren, mengen, formatteren, bemonsteren) over modellen van 1B-8B en tokenbudgetten van 6.25B-200B. De modellen worden vervolgens geëvalueerd op een zorgvuldig geselecteerde reeks van maximaal 52 downstream benchmarks uit 9 domeinen. Wij voeren uitgebreide experimenten uit op DCVLM en ontdekken dat datamenging, niet filtering, de sleutel is tot een hoogwaardige trainingsdataset: instructie-rijke mengsels schalen beter dan onderschrift-rijke, waarbij de voordelen toenemen op grotere schaal. De resulterende dataset, DCVLM-Baseline, maakt het mogelijk om een 8B VLM te trainen tot 63,6% nauwkeurigheid op onze 33-taak kernsuite met 200B trainings tokens. Vergeleken met FineVision, de state-of-the-art open VLM-trainingsdataset, is dit een verbetering van +5,4 procentpunt. DCVLM en alle bijbehorende artefacten zullen openbaar beschikbaar worden gesteld op https://www.datacomp.ai/dcvlm/.
English
Building performant Vision-Language Models (VLMs) requires carefully curating large-scale training datasets, yet the community lacks systematic benchmarks for evaluating such curation strategies. We introduce DataComp for VLMs (DCVLM), a benchmark for controlled data-centric experiments to improve VLM training. As part of DCVLM, we collect 160 datasets spanning four data types -- image-caption pairs, multimodal interleaved documents, text-only, and instruction-tuning data -- into a corpus of 6T multimodal tokens. DCVLM allows participants to test curation strategies (filtering, mixing, formatting, sampling) across 1B-8B models and 6.25B-200B token budgets. Models are then evaluated on a carefully selected suite of up to 52 downstream benchmarks across 9 domains. We conduct extensive experiments on DCVLM and find that data mixing, not filtering, is key to a high-quality training dataset: instruction-heavy mixtures scale better than caption-heavy ones, with gains widening at larger scales. The resulting dataset, DCVLM-Baseline, enables training an 8B VLM to 63.6% accuracy on our 33-task core suite with 200B training tokens. Compared to FineVision, the state-of-the-art open VLM training dataset, this represents an improvement of +5.4pp. DCVLM and all accompanying artifacts will be made publicly available at https://www.datacomp.ai/dcvlm/.