ChatPaper.aiChatPaper

Tmax: Uma receita simples para agentes terminais

Tmax: A simple recipe for terminal agents

June 22, 2026
Autores: Hamish Ivison, Junjie Oscar Yin, Rulin Shao, Teng Xiao, Nathan Lambert, Hannaneh Hajishirzi
cs.AI

Resumo

Agentes que utilizam terminal rapidamente se tornaram a aplicação downstream mais popular de modelos de linguagem (LMs). Apesar de sua prevalência, relativamente pouco trabalho acadêmico examinou o treinamento baseado em RL desses modelos, provavelmente devido a benchmarks difíceis, falta de dados e falta de receitas baseline simples. Apresentamos Tmax, a receita de RL aberta mais forte para agentes de terminal até o momento, aproximando receitas de dados abertos da fronteira. Embora simples, nossa receita alcança 27% no Terminal-Bench 2.0 com apenas 9B parâmetros, superando modelos muito maiores de trabalhos anteriores. Concretamente, geramos dados usando uma nova taxonomia, combinando controle de dificuldade, personas e diversificação de verificadores, o que nos permite gerar barato grandes quantidades de ambientes de terminal para treinamento RL e SFT. Disponibilizamos como código aberto nosso conjunto de dados de terminal, que é mais de 2,5 vezes maior que conjuntos de dados de agentes de terminal lançados anteriormente. Em seguida, treinamos modelos de pesos abertos usando RL com nossos dados, utilizando uma receita simples, apenas baseada em resultado. Liberamos nossos dados, modelos e código como uma base sólida para futuros trabalhos acadêmicos abertos sobre agentes de terminal em https://github.com/hamishivi/tmax.
English
Terminal-using agents have quickly become the most popular downstream application of language models (LMs). Despite their prevalence, relatively little academic work has examined RL-based training of these models, likely due to difficult benchmarks, a lack of data, and a lack of simple baseline recipes. We present Tmax, the strongest open RL recipe for terminal agents to date, bringing open data recipes closer to the frontier. While simple, our recipe achieves 27\% on Terminal-Bench 2.0 with only 9B parameters, outperforming much larger models from prior work. Concretely, we generate data using a novel taxonomy, combining difficulty control, personas, and verifier diversification, which allows us to cheaply generate large amounts of terminal environments for RL and SFT training. We open-source our terminal dataset, which is over 2.5x larger than previously released terminal-agent datasets. We then train open-weight models using RL with our data, using a simple, outcome-only recipe. We release our data, models, and code as a strong baseline for future open academic work on terminal agents at https://github.com/hamishivi/tmax.