Ideeën hebben genomen: benchmarken van wetenschappelijk afstammingsredeneren en op afstamming gebaseerde ideeëngeneratie
Ideas Have Genomes: Benchmarking Scientific Lineage Reasoning and Lineage-Grounded Idea Generation
July 9, 2026
Auteurs: Yifan Zhou, Qihao Yang, Yan Li, Donggang Li, Xiru Hu, Hokin Deng, Ziyang Gong, Xuanyi Zhou, Huacan Wang, Xiangchao Yan, Wanghan Xu, Wenlong Zhang, Shaofeng Zhang, Yue Zhou, Yifan Yang, Zhihang Zhong, Xue Yang
cs.AI
Samenvatting
Wetenschappelijke ideeën komen zelden uit het niets. Ze erven mechanismen over, herstellen bekende beperkingen en combineren stukken van eerder werk, veel op de manier van biologische genomen. Huidige benchmarks zeggen nog maar weinig over of AI-systemen deze overervingsstructuur kunnen volgen. We presenteren IdeaGene-Bench (IG-Bench), een benchmark voor het redeneren over wetenschappelijke afstamming en het genereren van ideeën die aan die afstamming zijn gebonden. IG-Bench is opgezet rond het IdeaGene-kader: elk artikel of voorstel wordt weergegeven als een verzameling minimale, getypeerde, op bewijzen gebaseerde Idea Genome-objecten, en een GenomeDiff brengt deze objecten met elkaar in verband om overerving, mutatie, verlies, externe import en nieuwe invoeging vast te leggen onder zes operationele evolutionaire dynamieken. De benchmark bevat 1.961 gouden afstammingssporen, 1.085 samengestelde Idea Genome-objecten en 920 paarsgewijze GenomeDiff-records uit 10 wetenschappelijke domeinen. Het ondersteunt twee evaluaties. IG-Exam (42 taaktypen, 1.029 instanties) test het gesloten redeneren over afstamming, op het niveau van abstractie van Idea Genome, het traceren van overerving, evolutionair redeneren en verificatie van afstamming. IG-Arena evalueert het genereren met een aan afstamming gerelateerde Population-Evolution Score (PES), die vraagt of een voorstel kan worden ingevoegd als een coherente afstammeling van een gegeven afstammingspopulatie: het moet de juiste Idea Genome-objecten overnemen, zinvol variëren ten opzichte van verwant werk, en selectiewaarde bieden voor toekomstig onderzoek. Experimenten met 14 op LLM gebaseerde wetenschappers leggen een compositorische bottleneck bloot. Het sterkste systeem behaalt slechts 27,3% exacte nauwkeurigheid bij het redeneren over afstamming, en gestructureerde afstammingscontext herschikt de rangschikking van systemen in plaats dat het elke deelnemer uniform helpt.
English
Scientific ideas rarely start from a blank page. They inherit mechanisms, repair known limitations, and recombine pieces of earlier work, much like biological genomes. Current benchmarks still say little about whether AI systems can follow this inheritance structure. We present IdeaGene-Bench (IG-Bench), a benchmark for scientific lineage reasoning and lineage-grounded idea generation. IG-Bench is organized around the IdeaGene framework: each paper or proposal is represented as a set of minimal, typed, evidence-grounded Idea Genome objects, and a GenomeDiff aligns these objects to record inheritance, mutation, loss, external import, and novel insertion under six operational evolutionary dynamics. The benchmark contains 1,961 golden lineage traces, 1,085 curated Idea Genome objects, and 920 pairwise GenomeDiff records across 10 scientific domains. It supports two evaluations. IG-Exam (42 task types, 1,029 instances) tests closed-form lineage reasoning across Idea Genome abstraction, inheritance tracing, evolutionary reasoning, and lineage verification. IG-Arena evaluates generation with a lineage-conditioned Population-Evolution Score(PES), asking whether a proposal can be inserted as a coherent descendant of a given lineage population: it should inherit the right Idea Genome objects, vary meaningfully from nearby work, and offer selection value for future research. Experiments on 14 LLM-based scientists expose a compositional bottleneck. The strongest system reaches only 27.3% exact accuracy on lineage reasoning, and structured lineage context reshuffles system rankings rather than helping every participant uniformly.