Escalando o Horizonte, Não os Parâmetros: Alcançando Desempenho de Trilhão de Parâmetros com um Agente de 35B
Scaling the Horizon, Not the Parameters: Reaching Trillion-Parameter Performance with a 35B Agent
June 29, 2026
Autores: Lei Bai, Zongsheng Cao, Yang Chen, Zhiyao Cui, Shangheng Du, Yue Fan, Shiyang Feng, Zijie Guo, Haonan He, Liang He, Xiaohan He, Shuyue Hu, Yusong Hu, Songtao Huang, Yichen Jiang, Hao Li, Xin Li, Dahua Lin, Weihao Lin, Fenghua Ling, Dongrui Liu, Zhuo Liu, Runmin Ma, Chunjiang Mu, Haoyang Peng, Tianshuo Peng, Jinxin Shi, Luohe Shi, Boyuan Sun, Zelin Tan, Shengji Tang, Qianyi Wang, Yiming Wu, Yi Xie, Xiangchao Yan, Jingqi Ye, Peng Ye, Fangchen Yu, Jiakang Yuan, Bihao Zhan, Bo Zhang, Chen Zhang, Shufei Zhang, Shuaiyu Zhang, Wenlong Zhang, Yiqun Zhang, Junpeng Zhao, Zhijie Zhong, Bowen Zhou, Yuhao Zhou
cs.AI
Resumo
Apresentamos o Agents-A1, um modelo de agente de 35B com mistura de especialistas (Mixture-of-Experts) que atinge desempenho ao nível de trilhões de parâmetros ao escalonar o horizonte do agente. Investigamos o escalonamento do horizonte do agente sob duas perspectivas: o escalonamento de trajetórias de longo horizonte e o escalonamento de habilidades heterogêneas do agente. Para apoiar esse objetivo, construímos uma infraestrutura de conhecimento-ação de longo horizonte que conecta conhecimento externo, ações, observações e resultados de verificadores, produzindo trajetórias de agente com comprimento médio de 45 mil tokens. Com base nisso, treinamos o Agents-A1 com um processo em três estágios. Primeiro, realizamos um ajuste fino supervisionado em domínio completo para alinhar o modelo base com comportamentos amplos de agente. Segundo, treinamos modelos professores em nível de domínio para capturar expertise especializada em cada domínio. Terceiro, propomos uma destilação on-policy com roteamento entre domínios, utilizando múltiplos professores e alinhamento de vocabulário saliente, para melhorar a eficiência da transferência de conhecimento entre diferentes domínios, unificando seis domínios heterogêneos em um único modelo aluno implantável. O Agents-A1 alcança desempenho forte e abrangente em benchmarks de agentes de longo horizonte. Comparado a modelos de 1 trilhão de parâmetros, como Kimi-K2.6 e DeepSeek-V4-pro, o Agents-A1 obtém resultados líderes no SEAL-0 (56,4), IFBench (80,6), HiPhO (46,4), FrontierScience-Olympiad (79,0) e MolBench-Bind (56,8), e permanece altamente competitivo no SciCode (44,3), HLE (47,6) e BrowseComp (75,5). Esperamos que este trabalho forneça à comunidade um caminho prático para escalonar o horizonte usando um agente de 35B que pode alcançar ou igualar o desempenho de modelos de 1T em tarefas de longo horizonte.
English
We introduce Agents-A1, a 35B Mixture-of-Experts Agentic Model that reaches trillion-parameter-level performance by scaling the agent horizon. We investigate agent-horizon scaling from two perspectives: scaling long-horizon trajectories and scaling heterogeneous agent abilities. To support this goal, we build a long-horizon knowledge-action infrastructure that connects external knowledge, actions, observations, and verifier outcomes, producing agentic trajectories with an average length of 45K tokens. Based on this, we train Agents-A1 with a three-stage recipe. First, we perform full-domain supervised fine-tuning to align the base model with broad agentic behaviors. Second, we train domain-level teacher models to capture specialized expertise in each domain. Third, we propose a multi-teacher domain-routed on-policy distillation with salient vocabulary alignment to improve knowledge transfer efficiency across different domains, unifying six heterogeneous domains into one deployable student model. Agents-A1 achieves strong and broad performance for long-horizon agent benchmarks. Compared with 1T-parameter model such as Kimi-K2.6 and DeepSeek-V4-pro, Agents-A1 achieves leading results on SEAL-0 (56.4), IFBench (80.6), HiPhO (46.4), FrontierScience-Olympiad (79.0), and MolBench-Bind (56.8), and remains highly competitive on SciCode (44.3), HLE (47.6) and BrowseComp (75.5). We hope this work provides the community with a practical path for scaling the horizon using a 35B agent that can reach or match the performance of 1T models on long-horizon tasks.