Les idées ont des génomes : évaluation comparative du raisonnement sur la lignée scientifique et de la génération d'idées fondée sur la lignée
Ideas Have Genomes: Benchmarking Scientific Lineage Reasoning and Lineage-Grounded Idea Generation
July 9, 2026
Auteurs: Yifan Zhou, Qihao Yang, Yan Li, Donggang Li, Xiru Hu, Hokin Deng, Ziyang Gong, Xuanyi Zhou, Huacan Wang, Xiangchao Yan, Wanghan Xu, Wenlong Zhang, Shaofeng Zhang, Yue Zhou, Yifan Yang, Zhihang Zhong, Xue Yang
cs.AI
Résumé
Les idées scientifiques naissent rarement d'une page blanche. Elles héritent de mécanismes, réparent des limitations connues et recombinent des fragments de travaux antérieurs, à la manière des génomes biologiques. Les bancs d'essai actuels ne renseignent guère sur la capacité des systèmes d'IA à suivre cette structure d'héritage. Nous présentons IdeaGene-Bench (IG-Bench), un banc d'essai pour le raisonnement sur les lignées scientifiques et la génération d'idées fondée sur ces lignées. IG-Bench s'organise autour du cadre IdeaGene : chaque article ou proposition est représenté comme un ensemble d'objets Génome d'Idée minimaux, typés et fondés sur des preuves, et un GenomeDiff aligne ces objets pour enregistrer héritage, mutation, perte, import externe et insertion nouvelle selon six dynamiques évolutives opérationnelles. Le banc d'essai contient 1 961 traces de lignées dorées, 1 085 objets Génome d'Idée curatés et 920 enregistrements de GenomeDiff par paires dans 10 domaines scientifiques. Il soutient deux types d'évaluation. IG-Exam (42 types de tâches, 1 029 instances) teste le raisonnement sur les lignées en forme fermée à travers l'abstraction du Génome d'Idée, le traçage de l'héritage, le raisonnement évolutif et la vérification des lignées. IG-Arena évalue la génération à l'aide d'un Score d'Évolution de Population (PES) conditionné par lignée, qui vérifie si une proposition peut être insérée comme descendant cohérent d'une population de lignée donnée : elle doit hériter des bons objets Génome d'Idée, varier de manière significative par rapport aux travaux proches et offrir une valeur sélective pour la recherche future. Des expériences menées sur 14 scientifiques basés sur des LLM révèlent un goulot d'étranglement compositionnel. Le système le plus performant n'atteint que 27,3 % d'exactitude exacte sur le raisonnement des lignées, et un contexte de lignée structuré remanie les classements des systèmes plutôt que d'aider chaque participant de manière uniforme.
English
Scientific ideas rarely start from a blank page. They inherit mechanisms, repair known limitations, and recombine pieces of earlier work, much like biological genomes. Current benchmarks still say little about whether AI systems can follow this inheritance structure. We present IdeaGene-Bench (IG-Bench), a benchmark for scientific lineage reasoning and lineage-grounded idea generation. IG-Bench is organized around the IdeaGene framework: each paper or proposal is represented as a set of minimal, typed, evidence-grounded Idea Genome objects, and a GenomeDiff aligns these objects to record inheritance, mutation, loss, external import, and novel insertion under six operational evolutionary dynamics. The benchmark contains 1,961 golden lineage traces, 1,085 curated Idea Genome objects, and 920 pairwise GenomeDiff records across 10 scientific domains. It supports two evaluations. IG-Exam (42 task types, 1,029 instances) tests closed-form lineage reasoning across Idea Genome abstraction, inheritance tracing, evolutionary reasoning, and lineage verification. IG-Arena evaluates generation with a lineage-conditioned Population-Evolution Score(PES), asking whether a proposal can be inserted as a coherent descendant of a given lineage population: it should inherit the right Idea Genome objects, vary meaningfully from nearby work, and offer selection value for future research. Experiments on 14 LLM-based scientists expose a compositional bottleneck. The strongest system reaches only 27.3% exact accuracy on lineage reasoning, and structured lineage context reshuffles system rankings rather than helping every participant uniformly.