ChatPaper.aiChatPaper

DianShi-RxnDB: 연구자와 AI 에이전트를 위한 완전 자동화 파이프라인을 통해 구축된 대규모·세분화된 유기 반응 데이터 플랫폼

DianShi-RxnDB: A Large-Scale, Fine-Grained Organic Reaction Data Platform Built via a Fully Automated Pipeline for Researchers and AI Agents

September 6, 2026
저자: Yubin Wang, Xingjian Wei, Jiang Wu, Yinfan Wang, Boyu Zhu, Lin Zhang, Jianing Yu, Huazheng Zeng, Ruiyi Ding, Junyuan Gao, Jiaxing Sun, Lingli Ge, Haote Yang, Jingchao Wang, Aijia Guo, Qian Jiang, Yurui Zhao, Wenjian Zhang, Chen Zhu, Lijun Wu, Xiaolei Yang, Haodong Chen, Junjie Yuan, Zichao Ye, Shaowei Hou, Jing Ye, Jia Yu, Shan Wang, Lijun Wu, Jiantao Qiu, Chao Xu, Yuqiang Li, Guangyu Wang, Bowen Zhou, Dahua Lin, Conghui He
cs.AI

초록

고품질의 구조화된 유기 반응 데이터는 화학을 위한 인공지능(AI4Chem) 개발에 필수적이지만, 이러한 지식의 상당 부분은 여전히 특허 텍스트, 이미지, 반응식에 분산되어 있다. 우리는 특허 텍스트, 이미지, 반응식을 통합하는 완전 자동화 추출 및 정규화 파이프라인을 통해 구축된 대규모의 세분화된 유기 반응 데이터 플랫폼인 DianShi-RxnDB를 제시한다. 이 코퍼스는 1976년부터 2025년 사이에 공개된 USPTO 및 EPO의 유기 합성 특허를 포괄하며, 약 2,400만 건의 반응 사례를 생성하고, 이 중 약 1,480만 건(61.7%)이 자동화된 적격성 검사를 통과한다. 각 사례는 반응 참여물, 역할, 양, 온도, 반응 시간, 수율, 실험 절차, 출처 특허로의 출처 링크를 기록한 특정 단일 단계 실험을 나타낸다. 적격 판정된 사례 중 표본 1,300건에 대한 수동 평가에서 마이크로 평균 필드 수준 정확도는 92.95%였다. Pistachio와의 매칭 비교는 중복 제거된 레코드 수, 표현 세분성, 필드 수준 완전 일치에서 우위를 추가로 보여주었다. 이 플랫폼은 레코드를 검색, 필터링, 비교, 출처 검증하기 위한 웹 연구 워크벤치와 AI 에이전트에게 구성 가능한 구조화 검색 도구를 제공하는 Model Context Protocol(MCP) 서비스를 제공한다. DianShi-RxnDB는 https://dianshi.opendatalab.org.cn/ 에서 이용할 수 있다.
English
High-quality structured organic reaction data are essential for developing artificial intelligence for chemistry (AI4Chem), yet much of this knowledge remains dispersed across patent text, images, and reaction schemes. We present DianShi-RxnDB, a large-scale, fine-grained organic reaction data platform built via a fully automated extraction and normalization pipeline integrating patent text, images, and reaction schemes. Its corpus covers organic synthesis patents from the USPTO and EPO published between 1976 and 2025, yielding approximately 24 million reaction instances, of which approximately 14.8 million (61.7%) pass automated qualification checks. Each instance represents a specific single-step experiment recording participants, roles, quantities, temperatures, reaction times, yields, experimental procedures, and provenance links to source patents. In a manual evaluation of 1,300 sampled qualified instances, the micro-averaged field-level accuracy was 92.95%. A matched comparison with Pistachio further indicated advantages in deduplicated record counts, representation granularity, and field-level exact agreement. The platform provides a Web research workbench for searching, filtering, comparing, and source-verifying records, and a Model Context Protocol (MCP) service offering AI agents composable structured retrieval tools. DianShi-RxnDB is available at https://dianshi.opendatalab.org.cn/ .