Medindo a Lacuna entre Ideias de Pesquisa Humanas e de LLMs
Measuring the Gap Between Human and LLM Research Ideas
July 1, 2026
Autores: Ziyu Chen, Yilun Zhao, Arman Cohan
cs.AI
Resumo
LLMs são cada vez mais utilizados para gerar ideias de pesquisa, mas as avaliações existentes geralmente julgam ideias individuais com base em novidade, viabilidade ou preferência de especialistas. Em vez disso, perguntamos: até que ponto as ideias atualmente geradas por LLMs se distanciam das ideias de pesquisadores humanos? Para caracterizar essa lacuna, construímos uma estrutura de avaliação em larga escala para ideação a partir de artigos de pesquisa humana de alta qualidade. Para cada artigo, reconstruímos engenharia reversa de um pequeno conjunto de trabalhos anteriores intimamente relacionados que provavelmente inspiraram sua ideia central. Os LLMs são então instruídos a gerar uma nova ideia a partir do conjunto de títulos e resumos dos artigos. Introduzimos uma taxonomia de gosto de pesquisa de dois eixos para traçar o perfil de cada ideia por seu padrão de oportunidade e paradigma de pesquisa, e a utilizamos para quantificar a divergência entre ideias humanas e de LLMs. Em conjuntos de ideias gerados por diferentes LLMs, observamos uma lacuna distribucional consistente: as ideias dos LLMs estão desproporcionalmente concentradas em torno de oportunidades do tipo ponte e métodos de síntese, enquanto a distribuição de referência dos artigos humanos se espalha mais amplamente por diferentes formas de enquadrar lacunas e construir contribuições. Esse resultado sugere que LLMs fortes podem produzir uma gama de ideias razoáveis, mas essa gama permanece mais estreita e sistematicamente deslocada em relação ao gosto de pesquisa humano.
English
LLMs are increasingly used to brainstorm research ideas, but existing evaluations mostly judge individual ideas by novelty, feasibility, or expert preference. We instead ask: how far are current LLM-generated ideas from human researchers? To characterize this gap, we build a large-scale evaluation framework for ideation from high-quality human research papers. For each paper, we reverse-engineer a small set of closely related prior works that likely inspired its core idea. LLMs are then prompted to generate a new idea from the set of paper titles and summaries. We introduce a two-axis research-taste taxonomy to profile each idea by its opportunity pattern and research paradigm, and use it to quantify the divergence between human and LLM ideas. Across idea sets generated by different LLMs, we observe a consistent distributional gap: LLM ideas are disproportionately concentrated around bridge-like opportunities and synthesis methods, whereas the human paper reference distribution spreads more broadly across ways of framing gaps and constructing contributions. This result suggests that strong LLMs can produce a range of reasonable ideas, but that range remains narrower than, and systematically shifted relative to, human research taste.