SciIR: Een grootschalige trainingsdataset en benchmark voor het genereren van wetenschappelijke beeldredeneringen
SciIR: A Large-scale Training Dataset and Benchmark for Scientific Image Reasoning Generation
June 29, 2026
Auteurs: Zhiyuan Ma, Zhengfeng Shi, Yuning An, Peize Li, Jiabao Wei, Ruijie Li, Junhao Xiao, Jianjun Li, Bowen Zhou
cs.AI
Samenvatting
Hoewel Text-to-Image (T2I)-modellen opmerkelijk succes hebben geboekt bij het genereren van fotorealistische visuele inhoud, worstelen ze nog steeds met de rigoureuze semantische afstemming en logische redenering die vereist zijn voor wetenschappelijke beelden. Geïnspireerd door Peirce's Semiotische Triade introduceren we Scientific Image Reasoning (SciIR), een uitgebreide bron voor training en evaluatie van wetenschappelijke beeldgeneratie. We formaliseren wetenschappelijke redenering in drie kerndimensies: Entiteitsstructuur (Icoon), Wetenschappelijk Proces (Index) en Natuurwet (Symbool). Om de schaarste aan trainingsgegevens bij wetenschappelijke beeldgeneratie te overwinnen, creëren we in het bijzonder SciIR-82k, een grootschalige dataset met meer dan 80.000 hoogwaardige wetenschappelijke beeld-tekstparen uit baanbrekende publicaties. De dataset is hiërarchisch georganiseerd volgens de semiotische dimensies en bevat een Scientific Reasoning Chain-of-Thought (Sci-RCoT) om de onderliggende visuele logica expliciet te modelleren. Voor evaluatie stellen we SciIR-Bench voor, dat aansluit bij deze drie semiotische niveaus en een Atomische Checklist gebruikt om de uitkomstgerichte wetenschappelijke nauwkeurigheid om te zetten in procesgerichte, verifieerbare, fijnmazige vragen. Onze uitgebreide experimenten onthullen aanzienlijke tekortkomingen in de wetenschappelijke redeneercapaciteiten van huidige modellen. Bovendien hebben we door middel van finetuning op de SciIR-82k-dataset het Qwen-Image-SciIR-model ontwikkeld, dat een aanzienlijke verbetering realiseert op de SciIR-Bench, waarbij de eindscores stijgen van 35% naar 43%, waarmee een solide basis wordt gelegd voor toekomstige vooruitgang in wetenschappelijke beeldgeneratie.
English
While Text-to-Image (T2I) models have shown remarkable success in generating photorealistic visual content, they still struggle with the rigorous semantic alignment and logical reasoning required for scientific imagery. Inspired by Peirce's Semiotic Triad, we introduce Scientific Image Reasoning (SciIR), a comprehensive resource for training and evaluation of scientific image generation. We formalize scientific reasoning into three core dimensions: Entity Structure (Icon), Scientific Process (Index), and Scientific Law (Symbol). Specifically, to overcome the scarcity of training data in scientific image generation, we elaborately create SciIR-82k, a large-scale dataset containing over 80,000 high-quality scientific image-text pairs from cutting-edge publications. The dataset is hierarchically organized according to the semiotic dimensions and incorporates a Scientific Reasoning Chain-of-Thought (Sci-RCoT) to explicitly model underlying visual logic. For evaluation, we propose SciIR-Bench, which aligns with these three semiotic levels and employs an Atomic Checklist to convert the outcome-oriented scientific accuracy into process-oriented, verifiable, fine-grained questions. Our extensive experiments reveal significant deficiencies in current models' scientific reasoning capabilities. Furthermore, by fine-tuning on the SciIR-82k dataset, we developed the Qwen-Image-SciIR model, which achieves a substantial improvement on the SciIR-Bench, increasing the final score from 35\% to 43\%, laying a solid foundation for future advances in scientific image generation.