NanoResearch: Coevolução de Habilidades, Memória e Políticas para Automação de Pesquisa Personalizada
NanoResearch: Co-Evolving Skills, Memory, and Policy for Personalized Research Automation
May 11, 2026
Autores: Jinhang Xu, Qiyuan Zhu, Yujun Wu, Zirui Wang, Dongxu Zhang, Jianxin Tang, Marcia Tian, Yiling Duan, Siyuan Li, Jingxuan Wei, Sirui Han, Yike Guo, Odin Zhang, Conghui He, Cheng Tan
cs.AI
Resumo
Sistemas multiagentes baseados em LLM agora podem automatizar todo o pipeline de pesquisa, desde a idealização até a escrita de artigos, mas uma questão fundamental permanece: automação para quem? Pesquisadores operam sob diferentes configurações de recursos, possuem diferentes preferências metodológicas e visam diferentes formatos de saída. Um sistema que produz resultados uniformes independentemente dessas diferenças atenderá sistematicamente de forma insuficiente cada usuário individual, tornando a personalização uma pré-condição para que a automação da pesquisa seja genuinamente utilizável. No entanto, alcançá-la exige três capacidades que os sistemas atuais não possuem: acumular conhecimento processual reutilizável entre projetos, reter experiência específica do usuário entre sessões e internalizar preferências implícitas que resistem à formalização explícita. Propomos o NanoResearch, um framework multiagente que aborda essas lacunas por meio de uma coevolução em três níveis. Um banco de habilidades destila operações recorrentes em regras processuais compactas reutilizáveis entre projetos. Um módulo de memória mantém a experiência específica do usuário e do projeto, fundamentando as decisões de planejamento no histórico de pesquisa de cada usuário. Um aprendizado de políticas sem rótulos converte feedback livre em atualizações persistentes de parâmetros do planejador, remodelando a coordenação subsequente. Essas três camadas coevoluem: habilidades confiáveis produzem memória mais rica, memória mais rica informa um melhor planejamento, e a internalização de preferências realinha continuamente o ciclo para cada usuário. Experimentos extensos demonstram que o NanoResearch proporciona ganhos substanciais em relação aos sistemas de pesquisa de IA de ponta e refina-se progressivamente para produzir melhor pesquisa a menor custo ao longo de ciclos sucessivos.
English
LLM-powered multi-agent systems can now automate the full research pipeline from ideation to paper writing, but a fundamental question remains: automation for whom? Researchers operate under different resource configurations, hold different methodological preferences, and target different output formats. A system that produces uniform outputs regardless of these differences will systematically under-serve every individual user, making personalization a precondition for research automation to be genuinely usable. However, achieving it requires three capabilities that current systems lack: accumulating reusable procedural knowledge across projects, retaining user-specific experience across sessions, and internalizing implicit preferences that resist explicit formalization. We propose NanoResearch, a multi-agent framework that addresses these gaps through tri-level co-evolution. A skill bank distills recurring operations into compact procedural rules reusable across projects. A memory module maintains user- and project-specific experience that grounds planning decisions in each user's research history. A label-free policy learning converts free-form feedback into persistent parameter updates of the planner, reshaping subsequent coordination. These three layers co-evolve: reliable skills produce richer memory, richer memory informs better planning, and preference internalization continuously realigns the loop to each user. Extensive experiments demonstrate that NanoResearch delivers substantial gains over state-of-the-art AI research systems, and progressively refines itself to produce better research at lower cost over successive cycles.