ChatPaper.aiChatPaper

У идей есть геномы: бенчмаркинг научного рассуждения о родословных и генерации идей на основе родословных

Ideas Have Genomes: Benchmarking Scientific Lineage Reasoning and Lineage-Grounded Idea Generation

July 9, 2026
Авторы: Yifan Zhou, Qihao Yang, Yan Li, Donggang Li, Xiru Hu, Hokin Deng, Ziyang Gong, Xuanyi Zhou, Huacan Wang, Xiangchao Yan, Wanghan Xu, Wenlong Zhang, Shaofeng Zhang, Yue Zhou, Yifan Yang, Zhihang Zhong, Xue Yang
cs.AI

Аннотация

Научные идеи редко возникают на пустом месте. Они наследуют механизмы, исправляют известные ограничения и перекомбинируют фрагменты предыдущих работ, во многом подобно биологическим геномам. Современные бенчмарки по-прежнему мало говорят о том, способны ли системы ИИ следовать этой структуре наследования. Мы представляем IdeaGene-Bench (IG-Bench) — бенчмарк для рассуждения о научной родословной и генерации идей, обусловленной этой родословной. IG-Bench построен на основе фреймворка IdeaGene: каждая статья или предложение представлены в виде набора минимальных, типизированных, обоснованных доказательствами объектов «Геном идей» (Idea Genome), а GenomeDiff выравнивает эти объекты для фиксации наследования, мутации, утраты, внешнего заимствования и нового введения в рамках шести операциональных эволюционных динамик. Бенчмарк содержит 1961 эталонный след родословной, 1085 отобранных объектов «Геном идей» и 920 парных записей GenomeDiff в 10 научных областях. Он поддерживает два вида оценки. IG-Exam (42 типа задач, 1029 экземпляров) проверяет рассуждение о родословной в закрытой форме, включая абстрагирование генома идей, отслеживание наследования, эволюционное рассуждение и верификацию родословной. IG-Arena оценивает генерацию с помощью обусловленной родословной оценки популяционно-эволюционного развития (Population-Evolution Score, PES): проверяется, может ли предложение быть встроено как связный потомок заданной популяции родословной — оно должно наследовать правильные объекты «Геном идей», содержательно отличаться от близких работ и обладать селекционной ценностью для будущих исследований. Эксперименты на 14 LLM-учёных выявили композиционное узкое место. Самая сильная система достигает лишь 27,3% точного совпадения в рассуждении о родословной, а структурированный контекст родословной перетасовывает рейтинг систем, а не помогает всем участникам одинаково.
English
Scientific ideas rarely start from a blank page. They inherit mechanisms, repair known limitations, and recombine pieces of earlier work, much like biological genomes. Current benchmarks still say little about whether AI systems can follow this inheritance structure. We present IdeaGene-Bench (IG-Bench), a benchmark for scientific lineage reasoning and lineage-grounded idea generation. IG-Bench is organized around the IdeaGene framework: each paper or proposal is represented as a set of minimal, typed, evidence-grounded Idea Genome objects, and a GenomeDiff aligns these objects to record inheritance, mutation, loss, external import, and novel insertion under six operational evolutionary dynamics. The benchmark contains 1,961 golden lineage traces, 1,085 curated Idea Genome objects, and 920 pairwise GenomeDiff records across 10 scientific domains. It supports two evaluations. IG-Exam (42 task types, 1,029 instances) tests closed-form lineage reasoning across Idea Genome abstraction, inheritance tracing, evolutionary reasoning, and lineage verification. IG-Arena evaluates generation with a lineage-conditioned Population-Evolution Score(PES), asking whether a proposal can be inserted as a coherent descendant of a given lineage population: it should inherit the right Idea Genome objects, vary meaningfully from nearby work, and offer selection value for future research. Experiments on 14 LLM-based scientists expose a compositional bottleneck. The strongest system reaches only 27.3% exact accuracy on lineage reasoning, and structured lineage context reshuffles system rankings rather than helping every participant uniformly.