ChatPaper.aiChatPaper

Las ideas tienen genomas: benchmarking del razonamiento sobre linajes científicos y la generación de ideas basada en linajes

Ideas Have Genomes: Benchmarking Scientific Lineage Reasoning and Lineage-Grounded Idea Generation

July 9, 2026
Autores: Yifan Zhou, Qihao Yang, Yan Li, Donggang Li, Xiru Hu, Hokin Deng, Ziyang Gong, Xuanyi Zhou, Huacan Wang, Xiangchao Yan, Wanghan Xu, Wenlong Zhang, Shaofeng Zhang, Yue Zhou, Yifan Yang, Zhihang Zhong, Xue Yang
cs.AI

Resumen

Las ideas científicas rara vez parten de una hoja en blanco. Heredan mecanismos, reparan limitaciones conocidas y recombinan fragmentos de trabajos previos, de manera similar a los genomas biológicos. Los benchmarks actuales aún dicen poco sobre si los sistemas de IA pueden seguir esta estructura de herencia. Presentamos IdeaGene-Bench (IG-Bench), un benchmark para el razonamiento de linajes científicos y la generación de ideas fundamentadas en linajes. IG-Bench se organiza en torno al marco IdeaGene: cada artículo o propuesta se representa como un conjunto de objetos mínimos, tipificados y basados en evidencia llamados Idea Genome, y un GenomeDiff alinea estos objetos para registrar herencia, mutación, pérdida, importación externa e inserción novedosa bajo seis dinámicas evolutivas operativas. El benchmark contiene 1.961 trazas de linaje doradas, 1.085 objetos Idea Genome curados y 920 registros de GenomeDiff por pares en 10 dominios científicos. Admite dos evaluaciones. IG-Exam (42 tipos de tareas, 1.029 instancias) evalúa el razonamiento de linaje de forma cerrada abarcando abstracción de Idea Genome, rastreo de herencia, razonamiento evolutivo y verificación de linaje. IG-Arena evalúa la generación con una Puntuación de Evolución de Población (PES) condicionada al linaje, preguntando si una propuesta puede insertarse como descendiente coherente de una población de linaje dada: debe heredar los objetos Idea Genome correctos, variar significativamente respecto a trabajos cercanos y ofrecer valor de selección para investigación futura. Los experimentos con 14 científicos basados en LLM revelan un cuello de botella compositivo. El sistema más fuerte alcanza solo un 27.3% de precisión exacta en razonamiento de linaje, y el contexto estructurado de linaje reordena las clasificaciones de los sistemas en lugar de ayudar a todos los participantes por igual.
English
Scientific ideas rarely start from a blank page. They inherit mechanisms, repair known limitations, and recombine pieces of earlier work, much like biological genomes. Current benchmarks still say little about whether AI systems can follow this inheritance structure. We present IdeaGene-Bench (IG-Bench), a benchmark for scientific lineage reasoning and lineage-grounded idea generation. IG-Bench is organized around the IdeaGene framework: each paper or proposal is represented as a set of minimal, typed, evidence-grounded Idea Genome objects, and a GenomeDiff aligns these objects to record inheritance, mutation, loss, external import, and novel insertion under six operational evolutionary dynamics. The benchmark contains 1,961 golden lineage traces, 1,085 curated Idea Genome objects, and 920 pairwise GenomeDiff records across 10 scientific domains. It supports two evaluations. IG-Exam (42 task types, 1,029 instances) tests closed-form lineage reasoning across Idea Genome abstraction, inheritance tracing, evolutionary reasoning, and lineage verification. IG-Arena evaluates generation with a lineage-conditioned Population-Evolution Score(PES), asking whether a proposal can be inserted as a coherent descendant of a given lineage population: it should inherit the right Idea Genome objects, vary meaningfully from nearby work, and offer selection value for future research. Experiments on 14 LLM-based scientists expose a compositional bottleneck. The strongest system reaches only 27.3% exact accuracy on lineage reasoning, and structured lineage context reshuffles system rankings rather than helping every participant uniformly.