ChatPaper.aiChatPaper

Het meten van de kloof tussen menselijke en LLM-onderzoeksideeën

Measuring the Gap Between Human and LLM Research Ideas

July 1, 2026
Auteurs: Ziyu Chen, Yilun Zhao, Arman Cohan
cs.AI

Samenvatting

LLM's worden steeds vaker gebruikt om onderzoeksideeën te genereren, maar bestaande evaluaties beoordelen individuele ideeën vooral op originaliteit, haalbaarheid of de voorkeur van experts. Wij stellen een andere vraag: hoe ver liggen huidige door LLM gegenereerde ideeën af van menselijke onderzoekers? Om deze kloof te karakteriseren, bouwen we een grootschalig evaluatiekader voor ideevorming op basis van hoogwaardige menselijke onderzoeksartikelen. Voor elk artikel reconstrueren we een kleine set nauw verwante eerdere werken die waarschijnlijk de kern van het idee inspireerden. Vervolgens wordt LLM's gevraagd een nieuw idee te genereren op basis van de titels en samenvattingen van die artikelen. We introduceren een tweedelige onderzoekssmaaktaxonomie om elk idee te profileren op basis van het kansenpatroon en het onderzoeksparadigma, en gebruiken deze om de divergentie tussen menselijke en LLM-ideeën te kwantificeren. Over sets van ideeën gegenereerd door verschillende LLM's heen zien we een consistente distributiekloof: LLM-ideeën zijn onevenredig geconcentreerd rond brugachtige kansen en synthesemethoden, terwijl de referentieverdeling van menselijke artikelen breder verspreid is over manieren om hiaten te framen en bijdragen te construeren. Dit resultaat suggereert dat sterke LLM's een reeks redelijke ideeën kunnen produceren, maar dat die reeks smaller blijft dan, en systematisch verschoven is ten opzichte van, de menselijke onderzoekssmaak.
English
LLMs are increasingly used to brainstorm research ideas, but existing evaluations mostly judge individual ideas by novelty, feasibility, or expert preference. We instead ask: how far are current LLM-generated ideas from human researchers? To characterize this gap, we build a large-scale evaluation framework for ideation from high-quality human research papers. For each paper, we reverse-engineer a small set of closely related prior works that likely inspired its core idea. LLMs are then prompted to generate a new idea from the set of paper titles and summaries. We introduce a two-axis research-taste taxonomy to profile each idea by its opportunity pattern and research paradigm, and use it to quantify the divergence between human and LLM ideas. Across idea sets generated by different LLMs, we observe a consistent distributional gap: LLM ideas are disproportionately concentrated around bridge-like opportunities and synthesis methods, whereas the human paper reference distribution spreads more broadly across ways of framing gaps and constructing contributions. This result suggests that strong LLMs can produce a range of reasonable ideas, but that range remains narrower than, and systematically shifted relative to, human research taste.