NanoResearch: Co-evoluerende vaardigheden, geheugen en beleid voor gepersonaliseerde onderzoeksautomatisering
NanoResearch: Co-Evolving Skills, Memory, and Policy for Personalized Research Automation
May 11, 2026
Auteurs: Jinhang Xu, Qiyuan Zhu, Yujun Wu, Zirui Wang, Dongxu Zhang, Jianxin Tang, Marcia Tian, Yiling Duan, Siyuan Li, Jingxuan Wei, Sirui Han, Yike Guo, Odin Zhang, Conghui He, Cheng Tan
cs.AI
Samenvatting
Door LLM aangedreven multi-agentsystemen kunnen nu de volledige onderzoekspijplijn automatiseren, van ideeontwikkeling tot paperschrijven, maar een fundamentele vraag blijft: automatisering voor wie? Onderzoekers opereren onder verschillende resourceconfiguraties, hanteren uiteenlopende methodologische voorkeuren en streven naar diverse outputformaten. Een systeem dat ongeacht deze verschillen uniforme output produceert, zal elke individuele gebruiker systematisch onderbedienen, waardoor personalisatie een voorwaarde wordt voor daadwerkelijke bruikbaarheid van onderzoeksautomatisering. Om dit te bereiken zijn echter drie mogelijkheden nodig die huidige systemen missen: het accumuleren van herbruikbare procedurele kennis over projecten heen, het bewaren van gebruikersspecifieke ervaring over sessies heen, en het internaliseren van impliciete voorkeuren die zich tegen expliciete formalisering verzetten. Wij stellen NanoResearch voor, een multi-agentframework dat deze lacunes aanpakt via co-evolutie op drie niveaus. Een vaardigheidsbank distilleert terugkerende operaties tot compacte procedurele regels die herbruikbaar zijn over projecten heen. Een geheugenmodule bewaart gebruikers- en projectspecifieke ervaring die planningsbeslissingen verankert in de onderzoeksgeschiedenis van elke gebruiker. Labelvrij beleidsleren zet vrije feedback om in blijvende parameterupdates van de planner, waardoor de daaropvolgende coördinatie opnieuw wordt vormgegeven. Deze drie lagen evolueren gezamenlijk: betrouwbare vaardigheden leveren rijker geheugen op, rijker geheugen informeert betere planning, en preferentie-internalisering blijft de cyclus opnieuw afstemmen op elke gebruiker. Uitgebreide experimenten tonen aan dat NanoResearch aanzienlijke winst oplevert ten opzichte van state-of-the-art AI-onderzoekssystemen, en zichzelf in opeenvolgende cycli progressief verfijnt om beter onderzoek tegen lagere kosten te produceren.
English
LLM-powered multi-agent systems can now automate the full research pipeline from ideation to paper writing, but a fundamental question remains: automation for whom? Researchers operate under different resource configurations, hold different methodological preferences, and target different output formats. A system that produces uniform outputs regardless of these differences will systematically under-serve every individual user, making personalization a precondition for research automation to be genuinely usable. However, achieving it requires three capabilities that current systems lack: accumulating reusable procedural knowledge across projects, retaining user-specific experience across sessions, and internalizing implicit preferences that resist explicit formalization. We propose NanoResearch, a multi-agent framework that addresses these gaps through tri-level co-evolution. A skill bank distills recurring operations into compact procedural rules reusable across projects. A memory module maintains user- and project-specific experience that grounds planning decisions in each user's research history. A label-free policy learning converts free-form feedback into persistent parameter updates of the planner, reshaping subsequent coordination. These three layers co-evolve: reliable skills produce richer memory, richer memory informs better planning, and preference internalization continuously realigns the loop to each user. Extensive experiments demonstrate that NanoResearch delivers substantial gains over state-of-the-art AI research systems, and progressively refines itself to produce better research at lower cost over successive cycles.