Ontsluiting van het visuele archief van de materiaalwetenschap: een grootschalige multimodale dataset uit wetenschappelijke literatuur
Unlocking the Visual Record of Materials Science: A Large-Scale Multimodal Dataset from Scientific Literature
June 29, 2026
Auteurs: Subham Ghosh, Shubham Tiwari, Mohammad Ibrahim, Abhishek Tewari
cs.AI
Samenvatting
De materiaalwetenschappelijke literatuur codeert decennia aan experimentele kennis in figuren, maar deze visuele schat blijft opgesloten en ontoegankelijk voor AI op grote schaal. De kernmoeilijkheid is structureel: de meeste wetenschappelijke figuren zijn samengesteld, waarbij één bijschrift meerdere subpanelen tegelijk beschrijft, wat directe koppeling van beeld en tekst onbetrouwbaar maakt. Wij presenteren MatMMExtract, een end-to-end open-source-pijplijn die dit oplost door samengestelde figuren te ontleden in individuele subpanelen en gestructureerde, gefundeerde annotaties te genereren met behulp van een groot taalmodel, geleid door een samengestelde materiaalwetenschappelijke taxonomie. Toegepast op 14.810 open-access artikelen produceert MatMMExtract MatSciFig: 391.606 paneelniveau-beeld-tekstparen uit 180.571 figuren, elk geannoteerd met een subbijschrift, een tweeledige visualisatiecategorie die 19 klassen en meer dan 100 subtypen omvat, en een wetenschappelijke samenvatting. Om nauwkeurige panellokalisatie mogelijk te maken, introduceren we MaterialScope, een domeinspecifieke detectiedataset met 2.811 handmatig geannoteerde materiaalwetenschappelijke figuren, waarop een fijngetunede YOLO12-m-detector een mAP_50 van 0,9227 behaalt. Van de zes geteste taalmodellen levert Gemini 3.1 Flash Lite de beste kosten-kwaliteitverhouding voor annotatiegeneratie, waarbij 82% van de uitvoer als goed wordt beoordeeld en het hallucinatiepercentage 4,8% bedraagt. Een dual-encoder-retrieval-baseline op MatSciFig behaalt een 4,4-voudige verbetering in R@1 ten opzichte van zero-shot CLIP, wat de directe bruikbaarheid van de dataset voor visie-taalleren aantoont. Alle bronnen worden openlijk ter beschikking gesteld aan de gemeenschap.
English
The materials science literature encodes decades of experimental knowledge in figures, yet this visual record remains locked away and inaccessible to AI at scale. The core difficulty is structural: most scientific figures are compound, with a single caption describing multiple sub-panels simultaneously, making direct image-text pairing unreliable. We present MatMMExtract, an end-to-end open-source pipeline that resolves this by decomposing compound figures into individual sub-panels and generating structured, grounded annotations using a large language model guided by a curated materials science taxonomy. Applied to 14,810 open-access articles, MatMMExtract produces MatSciFig; 391,606 panel-level image-text pairs from 180,571 figures, each annotated with a sub-caption, a two-level visualisation category spanning 19 classes and over 100 subtypes, and a scientific summary. To enable accurate panel localisation, we introduce MaterialScope, a domain-specific detection dataset of 2,811 manually annotated materials science figures, on which a fine-tuned YOLO12-m detector achieves mAP_50 of 0.9227. Among six benchmarked language models, Gemini 3.1 Flash Lite delivers the best cost-quality trade-off for annotation generation, with 82% of outputs rated good and a hallucination rate of 4.8%. A dual-encoder retrieval baseline on MatSciFig achieves a 4.4 times improvement in R@1 over zero-shot CLIP, demonstrating the dataset's immediate utility for vision-language learning. All resources are released openly to the community.