ChatPaper.aiChatPaper

Ideias Têm Genomas: Benchmarking do Raciocínio de Linhagem Científica e Geração de Ideias Fundamentada em Linhagem

Ideas Have Genomes: Benchmarking Scientific Lineage Reasoning and Lineage-Grounded Idea Generation

July 9, 2026
Autores: Yifan Zhou, Qihao Yang, Yan Li, Donggang Li, Xiru Hu, Hokin Deng, Ziyang Gong, Xuanyi Zhou, Huacan Wang, Xiangchao Yan, Wanghan Xu, Wenlong Zhang, Shaofeng Zhang, Yue Zhou, Yifan Yang, Zhihang Zhong, Xue Yang
cs.AI

Resumo

Ideias científicas raramente partem de uma página em branco. Elas herdam mecanismos, reparam limitações conhecidas e recombinam fragmentos de trabalhos anteriores, de forma semelhante aos genomas biológicos. Os benchmarks atuais ainda pouco dizem sobre se sistemas de IA conseguem seguir essa estrutura de herança. Apresentamos o IdeaGene-Bench (IG-Bench), um benchmark para raciocínio de linhagem científica e geração de ideias fundamentada em linhagens. O IG-Bench é organizado em torno da estrutura IdeaGene: cada artigo ou proposta é representado como um conjunto de objetos mínimos, tipados e baseados em evidências chamados Genoma de Ideia, e um GenomeDiff alinha esses objetos para registrar herança, mutação, perda, importação externa e inserção novel sob seis dinâmicas evolutivas operacionais. O benchmark contém 1.961 rastros dourados de linhagem, 1.085 objetos de Genoma de Ideia curados e 920 registros de GenomeDiff pareados em 10 domínios científicos. Ele oferece suporte a duas avaliações. O IG-Exam (42 tipos de tarefa, 1.029 instâncias) testa o raciocínio de linhagem em forma fechada, abrangendo abstração do Genoma de Ideia, rastreamento de herança, raciocínio evolutivo e verificação de linhagem. O IG-Arena avalia a geração com um Escore de Evolução Populacional (PES) condicionado à linhagem, perguntando se uma proposta pode ser inserida como descendente coerente de uma determinada população de linhagem: ela deve herdar os objetos corretos do Genoma de Ideia, variar significativamente em relação a trabalhos próximos e oferecer valor seletivo para pesquisas futuras. Experimentos com 14 cientistas baseados em LLM revelam um gargalo composicional. O sistema mais forte atinge apenas 27,3% de precisão exata no raciocínio de linhagem, e o contexto estruturado de linhagem reorganiza as classificações dos sistemas, em vez de ajudar todos os participantes de forma uniforme.
English
Scientific ideas rarely start from a blank page. They inherit mechanisms, repair known limitations, and recombine pieces of earlier work, much like biological genomes. Current benchmarks still say little about whether AI systems can follow this inheritance structure. We present IdeaGene-Bench (IG-Bench), a benchmark for scientific lineage reasoning and lineage-grounded idea generation. IG-Bench is organized around the IdeaGene framework: each paper or proposal is represented as a set of minimal, typed, evidence-grounded Idea Genome objects, and a GenomeDiff aligns these objects to record inheritance, mutation, loss, external import, and novel insertion under six operational evolutionary dynamics. The benchmark contains 1,961 golden lineage traces, 1,085 curated Idea Genome objects, and 920 pairwise GenomeDiff records across 10 scientific domains. It supports two evaluations. IG-Exam (42 task types, 1,029 instances) tests closed-form lineage reasoning across Idea Genome abstraction, inheritance tracing, evolutionary reasoning, and lineage verification. IG-Arena evaluates generation with a lineage-conditioned Population-Evolution Score(PES), asking whether a proposal can be inserted as a coherent descendant of a given lineage population: it should inherit the right Idea Genome objects, vary meaningfully from nearby work, and offer selection value for future research. Experiments on 14 LLM-based scientists expose a compositional bottleneck. The strongest system reaches only 27.3% exact accuracy on lineage reasoning, and structured lineage context reshuffles system rankings rather than helping every participant uniformly.