PlantMarkerBench: Um Benchmark Multiespécie para Raciocínio de Marcadores de Plantas Fundamentado em Evidências
PlantMarkerBench: A Multi-Species Benchmark for Evidence-Grounded Plant Marker Reasoning
May 11, 2026
Autores: Sajib Acharjee Dip, Song Li, Liqing Zhang
cs.AI
Resumo
Genes marcadores específicos de tipo celular são fundamentais para a biologia vegetal, porém os recursos existentes baseiam-se principalmente em bancos de dados curados ou estudos de alto rendimento, sem modelar explicitamente as evidências de suporte encontradas na literatura científica. Apresentamos o PlantMarkerBench, um referencial multi-espécies para avaliar a interpretação de evidências de marcadores vegetais fundamentadas na literatura, a partir de artigos biológicos completos. O PlantMarkerBench é construído utilizando um pipeline de curadoria modular que integra recuperação de literatura em larga escala, busca híbrida, fundamentação biológica consciente de espécies, extração estruturada de evidências e revisão humana direcionada. O referencial abrange quatro espécies de plantas — Arabidopsis, milho, arroz e tomate — e contém 5.550 instâncias de evidências em nível de sentença, anotadas quanto à validade da evidência de marcador, tipo de evidência e força de suporte. Definimos duas tarefas de referência: determinar se uma sentença candidata fornece evidência de marcador válida para um par gene-tipo celular, e classificar a evidência nas categorias expressão, localização, função, indireta ou negativa. Avaliamos diversos modelos de linguagem de pesos abertos e código fechado em diferentes espécies e estratégias de prompt. Embora os modelos de fronteira alcancem desempenho relativamente forte em evidências diretas de expressão, o desempenho cai substancialmente em evidências funcionais, indiretas e de suporte fraco, com a confusão entre tipos de evidência emergindo como um modo de falha dominante. Além disso, modelos de pesos abertos exibem taxas elevadas de falsos positivos em contextos biológicos ambíguos. O PlantMarkerBench fornece uma estrutura de avaliação desafiadora e reprodutível para a atribuição de evidências biológicas fundamentadas na literatura, e apoia pesquisas futuras sobre extração confiável de informações científicas e biologia vegetal assistida por IA.
English
Cell-type-specific marker genes are fundamental to plant biology, yet existing resources primarily rely on curated databases or high-throughput studies without explicitly modeling the supporting evidence found in scientific literature. We introduce PlantMarkerBench, a multi-species benchmark for evaluating literature-grounded plant marker evidence interpretation from full-text biological papers. PlantMarkerBench is constructed using a modular curation pipeline integrating large-scale literature retrieval, hybrid search, species-aware biological grounding, structured evidence extraction, and targeted human review. The benchmark spans four plant species -- Arabidopsis, maize, rice, and tomato -- and contains 5,550 sentence-level evidence instances annotated for marker-evidence validity, evidence type, and support strength. We define two benchmark tasks: determining whether a candidate sentence provides valid marker evidence for a gene-cell-type pair, and classifying the evidence into expression, localization, function, indirect, or negative categories. We benchmark diverse open-weight and closed-source language models across species and prompting strategies. Although frontier models achieve relatively strong performance on direct expression evidence, performance drops substantially on functional, indirect, and weak-support evidence, with evidence-type confusion emerging as a dominant failure mode. Open-weight models additionally exhibit elevated false-positive rates under ambiguous biological contexts. PlantMarkerBench provides a challenging and reproducible evaluation framework for literature-grounded biological evidence attribution and supports future research on trustworthy scientific information extraction and AI-assisted plant biology.