SciIR: Um conjunto de dados de treinamento em larga escala e benchmark para geração de raciocínio de imagens científicas
SciIR: A Large-scale Training Dataset and Benchmark for Scientific Image Reasoning Generation
June 29, 2026
Autores: Zhiyuan Ma, Zhengfeng Shi, Yuning An, Peize Li, Jiabao Wei, Ruijie Li, Junhao Xiao, Jianjun Li, Bowen Zhou
cs.AI
Resumo
Embora os modelos de Texto para Imagem (T2I) tenham demonstrado sucesso notável na geração de conteúdo visual fotorrealista, eles ainda enfrentam dificuldades com o rigoroso alinhamento semântico e raciocínio lógico exigidos para imagens científicas. Inspirados pela Tríade Semiótica de Peirce, apresentamos o Raciocínio de Imagem Científica (SciIR), um recurso abrangente para treinamento e avaliação da geração de imagens científicas. Formalizamos o raciocínio científico em três dimensões centrais: Estrutura de Entidade (Ícone), Processo Científico (Índice) e Lei Científica (Símbolo). Especificamente, para superar a escassez de dados de treinamento na geração de imagens científicas, elaboramos cuidadosamente o SciIR-82k, um conjunto de dados em larga escala contendo mais de 80.000 pares de imagem-texto científico de alta qualidade provenientes de publicações de vanguarda. O conjunto de dados é organizado hierarquicamente de acordo com as dimensões semióticas e incorpora uma Cadeia de Pensamento para Raciocínio Científico (Sci-RCoT) para modelar explicitamente a lógica visual subjacente. Para avaliação, propomos o SciIR-Bench, que se alinha com esses três níveis semióticos e emprega uma Lista de Verificação Atômica para converter a precisão científica orientada a resultados em questões verificáveis e de granulação fina orientadas a processos. Nossos extensos experimentos revelam deficiências significativas nas capacidades de raciocínio científico dos modelos atuais. Além disso, ao ajustar o modelo no conjunto de dados SciIR-82k, desenvolvemos o modelo Qwen-Image-SciIR, que alcança uma melhoria substancial no SciIR-Bench, aumentando a pontuação final de 35% para 43%, estabelecendo uma base sólida para futuros avanços na geração de imagens científicas.
English
While Text-to-Image (T2I) models have shown remarkable success in generating photorealistic visual content, they still struggle with the rigorous semantic alignment and logical reasoning required for scientific imagery. Inspired by Peirce's Semiotic Triad, we introduce Scientific Image Reasoning (SciIR), a comprehensive resource for training and evaluation of scientific image generation. We formalize scientific reasoning into three core dimensions: Entity Structure (Icon), Scientific Process (Index), and Scientific Law (Symbol). Specifically, to overcome the scarcity of training data in scientific image generation, we elaborately create SciIR-82k, a large-scale dataset containing over 80,000 high-quality scientific image-text pairs from cutting-edge publications. The dataset is hierarchically organized according to the semiotic dimensions and incorporates a Scientific Reasoning Chain-of-Thought (Sci-RCoT) to explicitly model underlying visual logic. For evaluation, we propose SciIR-Bench, which aligns with these three semiotic levels and employs an Atomic Checklist to convert the outcome-oriented scientific accuracy into process-oriented, verifiable, fine-grained questions. Our extensive experiments reveal significant deficiencies in current models' scientific reasoning capabilities. Furthermore, by fine-tuning on the SciIR-82k dataset, we developed the Qwen-Image-SciIR model, which achieves a substantial improvement on the SciIR-Bench, increasing the final score from 35\% to 43\%, laying a solid foundation for future advances in scientific image generation.