OpenThoughts-Agent: Receitas de Dados para Modelos Agênticos
OpenThoughts-Agent: Data Recipes for Agentic Models
June 23, 2026
Autores: Negin Raoof, Richard Zhuang, Marianna Nezhurina, Etash Guha, Atula Tejaswi, Ryan Marten, Charlie F. Ruan, Tyler Griggs, Alexander Glenn Shaw, Hritik Bansal, E. Kelly Buchanan, Artem Gazizov, Reinhard Heckel, Chinmay Hegde, Sankalp Jajee, Daanish Khazi, Emmanouil Koukoumidis, Xiangyi Li, Hange Liu, Shlok Natarajan, Harsh Raj, Nicholas Roberts, Ethan Shen, Nishad Singhi, Michael Siu, Ashima Suvarna, Hanwen Xing, Patrick Yubeaton, Robert Zhang, Leon Liangyu Chen, Xiaokun Chen, Steven Dillmann, Saadia Gabriel, Xunyi Jiang, Anurag Kashyap, Boxuan Li, Yein Park, Minh Pham, Sujay Sanghavi, Lin Shi, Ke Sun, Yixin Wang, Zhiwei Xu, Erica Zhang, Siyan Zhao, Wanjia Zhao, Jenia Jitsev, Alex Dimakis, Benjamin Feuer, Ludwig Schmidt
cs.AI
Resumo
Os modelos de linguagem agentivos expandem dramaticamente as aplicações da IA, mas pouco se sabe publicamente sobre como curar dados de treinamento para agentes com capacidades amplas. Esforços abertos existentes, como SWE-Smith, SERA e Nemotron-Terminal, geralmente visam um único benchmark, deixando em aberto a questão de como treinar modelos que generalizem para diversas tarefas agentivas. O projeto OpenThoughts-Agent (OT-Agent) aborda essa lacuna com um pipeline de curadoria de dados totalmente aberto para treinar modelos agentivos. Realizamos mais de 100 experimentos controlados de ablação para investigar sistematicamente cada etapa do pipeline, obtendo insights sobre a importância das fontes de tarefas e da diversidade. Em seguida, montamos um conjunto de treinamento de 100 mil exemplos a partir do nosso pipeline e ajustamos finamente o Qwen3-32B nesse conjunto de dados, o que resulta em uma precisão média de 44,8% em sete benchmarks agentivos e uma melhoria de 3,9 pontos percentuais em relação ao modelo agente de dados abertos existente mais forte (Nemotron-Terminal-32B, 40,9%). Além disso, nossos dados de treinamento apresentam fortes propriedades de escalabilidade, superando conjuntos de dados abertos alternativos em todos os tamanhos de conjunto de treinamento em comparações controladas por computação. Disponibilizamos publicamente nossos conjuntos de treinamento, pipeline de dados, dados experimentais e modelos em openthoughts.ai para apoiar futuras pesquisas abertas sobre treinamento de modelos agentivos.
English
Agentic language models dramatically expand the applications of AI yet little is publicly known about how to curate training data for broadly capable agents. Existing open efforts such as SWE-Smith, SERA, and Nemotron-Terminal typically target a single benchmark, leaving open the question of how to train models that generalize across diverse agentic tasks. The OpenThoughts-Agent (OT-Agent) project addresses this gap with a fully open data curation pipeline for training agentic models. We conduct more than 100 controlled ablation experiments to systematically investigate each stage of the pipeline, yielding insights on the importance of task sources and diversity. We then assemble a training set of 100K examples from our pipeline and fine-tune Qwen3-32B on this dataset, which yields an average accuracy of 44.8% across seven agentic benchmarks and a 3.9 percentage point improvement over the strongest existing open data agentic model (Nemotron-Terminal-32B, 40.9%). Moreover, our training data exhibits strong scaling properties, outperforming alternative open datasets at every training set size in compute-controlled comparisons. We publicly release our training sets, data pipeline, experimental data, and models at openthoughts.ai to support future open research on agentic model training.