ChatPaper.aiChatPaper

Desvendando o Registro Visual da Ciência dos Materiais: Um Conjunto de Dados Multimodal em Larga Escala da Literatura Científica

Unlocking the Visual Record of Materials Science: A Large-Scale Multimodal Dataset from Scientific Literature

June 29, 2026
Autores: Subham Ghosh, Shubham Tiwari, Mohammad Ibrahim, Abhishek Tewari
cs.AI

Resumo

A literatura de ciência dos materiais codifica décadas de conhecimento experimental em figuras, mas esse registro visual permanece inacessível para a IA em larga escala. A dificuldade central é estrutural: a maioria das figuras científicas é composta, com uma única legenda descrevendo vários subpainéis simultaneamente, tornando o pareamento direto imagem-texto não confiável. Apresentamos o MatMMExtract, um pipeline de código aberto de ponta a ponta que resolve esse problema decompondo figuras compostas em subpainéis individuais e gerando anotações estruturadas e fundamentadas usando um modelo de linguagem grande guiado por uma taxonomia de ciência dos materiais selecionada. Aplicado a 14.810 artigos de acesso aberto, o MatMMExtract produz o MatSciFig; 391.606 pares imagem-texto em nível de painel a partir de 180.571 figuras, cada um anotado com uma sublegenda, uma categoria de visualização de dois níveis abrangendo 19 classes e mais de 100 subtipos, e um resumo científico. Para permitir a localização precisa de painéis, introduzimos o MaterialScope, um conjunto de dados de detecção específico do domínio com 2.811 figuras de ciência dos materiais anotadas manualmente, no qual um detector YOLO12-m ajustado atinge mAP_50 de 0,9227. Entre seis modelos de linguagem avaliados, o Gemini 3.1 Flash Lite oferece o melhor equilíbrio custo-qualidade para geração de anotações, com 82% das saídas consideradas boas e uma taxa de alucinação de 4,8%. Uma linha de base de recuperação com codificador duplo no MatSciFig alcança uma melhoria de 4,4 vezes no R@1 em relação ao CLIP zero-shot, demonstrando a utilidade imediata do conjunto de dados para aprendizado visão-linguagem. Todos os recursos são disponibilizados abertamente para a comunidade.
English
The materials science literature encodes decades of experimental knowledge in figures, yet this visual record remains locked away and inaccessible to AI at scale. The core difficulty is structural: most scientific figures are compound, with a single caption describing multiple sub-panels simultaneously, making direct image-text pairing unreliable. We present MatMMExtract, an end-to-end open-source pipeline that resolves this by decomposing compound figures into individual sub-panels and generating structured, grounded annotations using a large language model guided by a curated materials science taxonomy. Applied to 14,810 open-access articles, MatMMExtract produces MatSciFig; 391,606 panel-level image-text pairs from 180,571 figures, each annotated with a sub-caption, a two-level visualisation category spanning 19 classes and over 100 subtypes, and a scientific summary. To enable accurate panel localisation, we introduce MaterialScope, a domain-specific detection dataset of 2,811 manually annotated materials science figures, on which a fine-tuned YOLO12-m detector achieves mAP_50 of 0.9227. Among six benchmarked language models, Gemini 3.1 Flash Lite delivers the best cost-quality trade-off for annotation generation, with 82% of outputs rated good and a hallucination rate of 4.8%. A dual-encoder retrieval baseline on MatSciFig achieves a 4.4 times improvement in R@1 over zero-shot CLIP, demonstrating the dataset's immediate utility for vision-language learning. All resources are released openly to the community.