OpenThoughts-Agent : Recettes de données pour modèles agentiques
OpenThoughts-Agent: Data Recipes for Agentic Models
June 23, 2026
Auteurs: Negin Raoof, Richard Zhuang, Marianna Nezhurina, Etash Guha, Atula Tejaswi, Ryan Marten, Charlie F. Ruan, Tyler Griggs, Alexander Glenn Shaw, Hritik Bansal, E. Kelly Buchanan, Artem Gazizov, Reinhard Heckel, Chinmay Hegde, Sankalp Jajee, Daanish Khazi, Emmanouil Koukoumidis, Xiangyi Li, Hange Liu, Shlok Natarajan, Harsh Raj, Nicholas Roberts, Ethan Shen, Nishad Singhi, Michael Siu, Ashima Suvarna, Hanwen Xing, Patrick Yubeaton, Robert Zhang, Leon Liangyu Chen, Xiaokun Chen, Steven Dillmann, Saadia Gabriel, Xunyi Jiang, Anurag Kashyap, Boxuan Li, Yein Park, Minh Pham, Sujay Sanghavi, Lin Shi, Ke Sun, Yixin Wang, Zhiwei Xu, Erica Zhang, Siyan Zhao, Wanjia Zhao, Jenia Jitsev, Alex Dimakis, Benjamin Feuer, Ludwig Schmidt
cs.AI
Résumé
Les modèles de langage agentiques étendent considérablement les applications de l'IA, mais on sait peu de choses publiquement sur la manière d'organiser les données d'entraînement pour des agents aux capacités étendues. Les efforts ouverts existants, tels que SWE-Smith, SERA et Nemotron-Terminal, ciblent généralement un seul benchmark, laissant ouverte la question de l'entraînement de modèles capables de généraliser à travers diverses tâches agentiques. Le projet OpenThoughts-Agent (OT-Agent) comble cette lacune avec un pipeline de curation de données entièrement ouvert pour l'entraînement de modèles agentiques. Nous menons plus de 100 expériences d'ablation contrôlées pour étudier systématiquement chaque étape du pipeline, obtenant des informations sur l'importance des sources de tâches et de la diversité. Nous assemblons ensuite un ensemble d'entraînement de 100 000 exemples issus de notre pipeline et affinons Qwen3-32B sur cet ensemble, ce qui donne une précision moyenne de 44,8 % sur sept benchmarks agentiques et une amélioration de 3,9 points de pourcentage par rapport au meilleur modèle agentique open source existant (Nemotron-Terminal-32B, 40,9 %). De plus, nos données d'entraînement présentent de fortes propriétés de mise à l'échelle, surpassant les autres ensembles de données ouverts à chaque taille d'ensemble d'entraînement dans des comparaisons contrôlées en calcul. Nous publions librement nos ensembles d'entraînement, notre pipeline de données, nos données expérimentales et nos modèles sur openthoughts.ai pour soutenir la recherche ouverte future sur l'entraînement de modèles agentiques.
English
Agentic language models dramatically expand the applications of AI yet little is publicly known about how to curate training data for broadly capable agents. Existing open efforts such as SWE-Smith, SERA, and Nemotron-Terminal typically target a single benchmark, leaving open the question of how to train models that generalize across diverse agentic tasks. The OpenThoughts-Agent (OT-Agent) project addresses this gap with a fully open data curation pipeline for training agentic models. We conduct more than 100 controlled ablation experiments to systematically investigate each stage of the pipeline, yielding insights on the importance of task sources and diversity. We then assemble a training set of 100K examples from our pipeline and fine-tune Qwen3-32B on this dataset, which yields an average accuracy of 44.8% across seven agentic benchmarks and a 3.9 percentage point improvement over the strongest existing open data agentic model (Nemotron-Terminal-32B, 40.9%). Moreover, our training data exhibits strong scaling properties, outperforming alternative open datasets at every training set size in compute-controlled comparisons. We publicly release our training sets, data pipeline, experimental data, and models at openthoughts.ai to support future open research on agentic model training.