ChatPaper.aiChatPaper

PlantMarkerBench: Een Multi-Soort Benchmark voor Op Bewijs Gebaseerd Redeneren over Plantmarkers

PlantMarkerBench: A Multi-Species Benchmark for Evidence-Grounded Plant Marker Reasoning

May 11, 2026
Auteurs: Sajib Acharjee Dip, Song Li, Liqing Zhang
cs.AI

Samenvatting

Celtype-specifieke markergenen zijn fundamenteel voor de plantenbiologie, maar bestaande bronnen zijn voornamelijk gebaseerd op samengestelde databases of high-throughput-studies zonder expliciet het ondersteunende bewijsmateriaal uit de wetenschappelijke literatuur te modelleren. We introduceren PlantMarkerBench, een multi-soortbenchmark voor het evalueren van op literatuur gebaseerde interpretatie van plantmarkerbewijs uit volledige teksten van biologische artikelen. PlantMarkerBench is opgebouwd met behulp van een modulaire curatiepijplijn die grootschalige literatuurretrieval, hybride zoeken, soortsbewuste biologische onderbouwing, gestructureerde extractie van bewijsmateriaal en gerichte menselijke beoordeling integreert. De benchmark omvat vier plantensoorten – Arabidopsis, mais, rijst en tomaat – en bevat 5.550 bewijsinstanties op zinsniveau die zijn geannoteerd voor geldigheid van markerbewijs, type bewijs en ondersteuningssterkte. We definiëren twee benchmarktaken: het bepalen of een kandidaatzin geldig markerbewijs levert voor een gen-celtype-paar, en het classificeren van het bewijs in expressie, localisatie, functie, indirect of negatief. We benchmarken diverse open-gewichts- en closed-source-taalmodelen over soorten en promptstrategieën. Hoewel grensverleggende modellen relatief sterke prestaties leveren op direct expressiebewijs, nemen de prestaties aanzienlijk af bij functioneel, indirect en zwak ondersteunend bewijs, waarbij verwarring over het bewijstype naar voren komt als dominante faalmodus. Open-gewichtsmodellen vertonen bovendien verhoogde fout-positieve percentages onder dubbelzinnige biologische contexten. PlantMarkerBench biedt een uitdagend en reproduceerbaar evaluatiekader voor op literatuur gebaseerde attributie van biologisch bewijs en ondersteunt toekomstig onderzoek naar betrouwbare extractie van wetenschappelijke informatie en AI-ondersteunde plantenbiologie.
English
Cell-type-specific marker genes are fundamental to plant biology, yet existing resources primarily rely on curated databases or high-throughput studies without explicitly modeling the supporting evidence found in scientific literature. We introduce PlantMarkerBench, a multi-species benchmark for evaluating literature-grounded plant marker evidence interpretation from full-text biological papers. PlantMarkerBench is constructed using a modular curation pipeline integrating large-scale literature retrieval, hybrid search, species-aware biological grounding, structured evidence extraction, and targeted human review. The benchmark spans four plant species -- Arabidopsis, maize, rice, and tomato -- and contains 5,550 sentence-level evidence instances annotated for marker-evidence validity, evidence type, and support strength. We define two benchmark tasks: determining whether a candidate sentence provides valid marker evidence for a gene-cell-type pair, and classifying the evidence into expression, localization, function, indirect, or negative categories. We benchmark diverse open-weight and closed-source language models across species and prompting strategies. Although frontier models achieve relatively strong performance on direct expression evidence, performance drops substantially on functional, indirect, and weak-support evidence, with evidence-type confusion emerging as a dominant failure mode. Open-weight models additionally exhibit elevated false-positive rates under ambiguous biological contexts. PlantMarkerBench provides a challenging and reproducible evaluation framework for literature-grounded biological evidence attribution and supports future research on trustworthy scientific information extraction and AI-assisted plant biology.