ScientistOne: Naar autonoom onderzoek op menselijk niveau via bewijsketen
ScientistOne: Towards Human-Level Autonomous Research via Chain-of-Evidence
May 25, 2026
Auteurs: Rui Meng, Bhavana Dalvi Mishra, Jiefeng Chen, Chun-Liang Li, Palash Goyal, Mihir Parmar, Yiwen Song, Yale Song, Rajarishi Sinha, Parthasarathy Ranganathan, Burak Gokturk, Jinsung Yoon, Tomas Pfister
cs.AI
Samenvatting
Autonome onderzoeksagenten leveren concurrerende oplossingen en professioneel ogende manuscripten, maar hun uitkomsten bevatten verifieerbaarheidsfouten die onopgemerkt blijven bij oppervlakkige evaluatie: verzonnen referenties, niet-reproduceerbare scores en methodebeschrijvingen die afwijken van de implementatie. We pakken dit aan met drie bijdragen. Ten eerste Chain-of-Evidence (CoE), een verifieerbaarheidskader dat vereist dat elke bewering herleidbaar is tot de bewijsbron. Ten tweede ScientistOne, een end-to-end autonoom onderzoekssysteem dat bewijsketens door constructie behoudt gedurende literatuuronderzoek, oplossingsontdekking en het schrijven van papers. Ten derde CoE Audit, een post-hoc-audit waarvan vier integriteitscontroles – scoreverificatie, specificatieschending, referentieverificatie en methode-code-afstemming – uniform worden toegepast op alle systemen. Over 75 papers, verspreid over vijf systemen en vijf baanbrekende onderzoekstaken, vertoont elke baseline ten minste één systematische faalmodus: het percentage gehallucineerde referenties bereikt 21%, scoreverificatie slaagt in slechts 42% van de papers, en methode-code-afstemming varieert van 20% tot 80%. ScientistOne bereikt nul gehallucineerde referenties (0/337), perfecte scoreverificatie (12/12) en de hoogste methode-code-afstemming (14/15), terwijl het op alle vijf taken de prestaties van menselijke experts evenaart of overtreft. ScientistOne generaliseert bovendien naar zes extra taken op het gebied van medische beeldvorming, fijnmazige herkenning, 3D-perceptie en taalmodellering, en behaalt state-of-the-art-resultaten op Parameter Golf en gouden medailles op MLE-Bench-taken waar baselines volledig falen.
English
Autonomous research agents produce competitive solutions and professional-looking manuscripts, yet their outputs contain verifiability failures undetectable by surface-level evaluation: fabricated citations, unreproducible scores, and method descriptions that diverge from the implementation. We address this through three contributions. First, Chain-of-Evidence (CoE), a verifiability framework requiring every claim to be traceable to its evidence source. Second, ScientistOne, an end-to-end autonomous research system that maintains evidence chains by construction throughout literature review, solution discovery, and paper writing. Third, CoE Audit, a post-hoc audit whose four integrity checks -- score verification, specification violation, reference verification, and method-code alignment -- apply uniformly to all systems. Across 75 papers spanning five systems and five frontier research tasks, every baseline exhibits at least one systematic failure mode: hallucinated reference rates reach 21%, score verification passes in as few as 42% of papers, and method-code alignment ranges from 20% to 80%. ScientistOne achieves zero hallucinated references (0/337), perfect score verification (12/12), and the highest method-code alignment (14/15), while matching or exceeding human expert performance on all five tasks. ScientistOne further generalizes to six additional tasks spanning medical imaging, fine-grained recognition, 3D perception, and language modeling, achieving state-of-the-art on Parameter Golf and gold medals on MLE-Bench tasks where baselines fail entirely.