ChatPaper.aiChatPaper

OpenSeeker-v2: Expandindo os Limites de Agentes de Busca com Trajetórias Informativas e de Alta Dificuldade

OpenSeeker-v2: Pushing the Limits of Search Agents with Informative and High-Difficulty Trajectories

May 5, 2026
Autores: Yuwen Du, Rui Ye, Shuo Tang, Keduan Huang, Xinyu Zhu, Yuzhu Cai, Siheng Chen
cs.AI

Resumo

As capacidades de busca profunda tornaram-se uma competência indispensável para agentes de LLM (Large Language Model) de fronteira, no entanto, o seu desenvolvimento continua dominado pelos gigantes industriais. A receita típica da indústria envolve um pipeline altamente intensivo em recursos que abrange pré-treinamento, pré-treinamento contínuo (CPT), ajuste fino supervisionado (SFT) e aprendizagem por reforço (RL). Neste relatório, mostramos que, quando alimentada com trajetórias informativas e de alta dificuldade, uma simples abordagem SFT pode ser surpreendentemente poderosa para treinar agentes de busca de fronteira. Ao introduzir três modificações simples na síntese de dados: escalonamento do tamanho do grafo de conhecimento para uma exploração mais rica, expansão do tamanho do conjunto de ferramentas para uma funcionalidade mais ampla e filtragem rigorosa por baixo número de etapas, estabelecemos uma linha de base mais forte. Treinado com apenas 10,6 mil pontos de dados, o nosso OpenSeeker-v2 atinge um desempenho de ponta em 4 benchmarks (agentes de 30B com paradigma ReAct): 46,0% no BrowseComp, 58,1% no BrowseComp-ZH, 34,6% no Humanity's Last Exam e 78,0% no xbench, superando até mesmo o Tongyi DeepResearch, treinado com o pesado pipeline CPT+SFT+RL, que atinge 43,4%, 46,7%, 32,9% e 75,0%, respectivamente. Notavelmente, o OpenSeeker-v2 representa o primeiro agente de busca de ponta dentro da sua escala de modelo e paradigma a ser desenvolvido por uma equipa puramente académica usando apenas SFT. Estamos entusiasmados por disponibilizar em código aberto os pesos do modelo OpenSeeker-v2 e partilhar as nossas descobertas simples mas eficazes para tornar a pesquisa de agentes de busca de fronteira mais acessível à comunidade.
English
Deep search capabilities have become an indispensable competency for frontier Large Language Model (LLM) agents, yet their development remains dominated by industrial giants. The typical industry recipe involves a highly resource-intensive pipeline spanning pre-training, continual pre-training (CPT), supervised fine-tuning (SFT), and reinforcement learning (RL). In this report, we show that when fueled with informative and high-difficulty trajectories, a simple SFT approach could be surprisingly powerful for training frontier search agents. By introducing three simple data synthesis modifications: scaling knowledge graph size for richer exploration, expanding the tool set size for broader functionality, and strict low-step filtering, we establish a stronger baseline. Trained on merely 10.6k data points, our OpenSeeker-v2 achieves state-of-the-art performance across 4 benchmarks (30B-sized agents with ReAct paradigm): 46.0% on BrowseComp, 58.1% on BrowseComp-ZH, 34.6% on Humanity's Last Exam, and 78.0% on xbench, surpassing even Tongyi DeepResearch trained with heavy CPT+SFT+RL pipeline, which achieves 43.4%, 46.7%, 32.9%, and 75.0%, respectively. Notably, OpenSeeker-v2 represents the first state-of-the-art search agent within its model scale and paradigm to be developed by a purely academic team using only SFT. We are excited to open-source the OpenSeeker-v2 model weights and share our simple yet effective findings to make frontier search agent research more accessible to the community.