ChatPaper.aiChatPaper

De horizon opschalen, niet de parameters: het bereiken van biljoen-parameterprestaties met een 35B-agent

Scaling the Horizon, Not the Parameters: Reaching Trillion-Parameter Performance with a 35B Agent

June 29, 2026
Auteurs: Lei Bai, Zongsheng Cao, Yang Chen, Zhiyao Cui, Shangheng Du, Yue Fan, Shiyang Feng, Zijie Guo, Haonan He, Liang He, Xiaohan He, Shuyue Hu, Yusong Hu, Songtao Huang, Yichen Jiang, Hao Li, Xin Li, Dahua Lin, Weihao Lin, Fenghua Ling, Dongrui Liu, Zhuo Liu, Runmin Ma, Chunjiang Mu, Haoyang Peng, Tianshuo Peng, Jinxin Shi, Luohe Shi, Boyuan Sun, Zelin Tan, Shengji Tang, Qianyi Wang, Yiming Wu, Yi Xie, Xiangchao Yan, Jingqi Ye, Peng Ye, Fangchen Yu, Jiakang Yuan, Bihao Zhan, Bo Zhang, Chen Zhang, Shufei Zhang, Shuaiyu Zhang, Wenlong Zhang, Yiqun Zhang, Junpeng Zhao, Zhijie Zhong, Bowen Zhou, Yuhao Zhou
cs.AI

Samenvatting

We introduceren Agents-A1, een 35B Mengsel-van-Experts Agentisch Model dat prestaties op biljoen-parameterniveau bereikt door de agenthorizon op te schalen. We onderzoeken het opschalen van de agenthorizon vanuit twee perspectieven: het opschalen van langetermijntrajecten en het opschalen van heterogene agentcapaciteiten. Ter ondersteuning van dit doel bouwen we een lange-horizon kennis-actie-infrastructuur die externe kennis, acties, observaties en verifieeruitkomsten verbindt, en agentische trajecten produceert met een gemiddelde lengte van 45K tokens. Op basis hiervan trainen we Agents-A1 met een driefasenrecept. Eerst voeren we volledige-domein gesuperviseerde finetuning uit om het basismodel af te stemmen op brede agentische gedragingen. Ten tweede trainen we domeinniveaudocentmodellen om gespecialiseerde expertise in elk domein vast te leggen. Ten derde stellen we een multi-docent domeingerouteerde on-policy distillatie voor met opvallende woordenlijstafstemming om de kennistransfer-efficiëntie over verschillende domeinen te verbeteren, waarbij zes heterogene domeinen worden verenigd in één inzetbaar studentmodel. Agents-A1 behaalt sterke en brede prestaties op lange-horizon agentbenchmarks. Vergeleken met 1T-parametermodellen zoals Kimi-K2.6 en DeepSeek-V4-pro behaalt Agents-A1 toonaangevende resultaten op SEAL-0 (56,4), IFBench (80,6), HiPhO (46,4), FrontierScience-Olympiad (79,0) en MolBench-Bind (56,8), en blijft het zeer concurrerend op SciCode (44,3), HLE (47,6) en BrowseComp (75,5). We hopen dat dit werk de gemeenschap een praktisch pad biedt voor het opschalen van de horizon met behulp van een 35B agent die de prestaties van 1T-modellen op langetermijntaken kan bereiken of evenaren.
English
We introduce Agents-A1, a 35B Mixture-of-Experts Agentic Model that reaches trillion-parameter-level performance by scaling the agent horizon. We investigate agent-horizon scaling from two perspectives: scaling long-horizon trajectories and scaling heterogeneous agent abilities. To support this goal, we build a long-horizon knowledge-action infrastructure that connects external knowledge, actions, observations, and verifier outcomes, producing agentic trajectories with an average length of 45K tokens. Based on this, we train Agents-A1 with a three-stage recipe. First, we perform full-domain supervised fine-tuning to align the base model with broad agentic behaviors. Second, we train domain-level teacher models to capture specialized expertise in each domain. Third, we propose a multi-teacher domain-routed on-policy distillation with salient vocabulary alignment to improve knowledge transfer efficiency across different domains, unifying six heterogeneous domains into one deployable student model. Agents-A1 achieves strong and broad performance for long-horizon agent benchmarks. Compared with 1T-parameter model such as Kimi-K2.6 and DeepSeek-V4-pro, Agents-A1 achieves leading results on SEAL-0 (56.4), IFBench (80.6), HiPhO (46.4), FrontierScience-Olympiad (79.0), and MolBench-Bind (56.8), and remains highly competitive on SciCode (44.3), HLE (47.6) and BrowseComp (75.5). We hope this work provides the community with a practical path for scaling the horizon using a 35B agent that can reach or match the performance of 1T models on long-horizon tasks.