CLI-Universe: Rumo a um Motor de Síntese de Tarefas Verificável para Agentes de Terminal
CLI-Universe: Towards Verifiable Task Synthesis Engine for Terminal Agents
June 22, 2026
Autores: Zhanbo Hua, Yifan Yao, Weihao Xie, Yongchi Zhao, Minghao Liu, Ruizhi Qiu, Zhewei Huang, Zun Wang, Yiyan Ji, Yunhai Ye, Letian Zhu, Xinping Lei, Han Li, Zhiyuan Ma, Zili Wang, Zhaoxiang Zhang, Jiaheng Liu
cs.AI
Resumo
Embora agentes terminais baseados em LLMs tenham demonstrado capacidades promissoras recentemente, a escassez de dados de treinamento executáveis e de alta qualidade continua sendo um gargalo crítico. Os pipelines de síntese existentes tipicamente escalam adaptando artefatos superficiais em tarefas, frequentemente resultando em instruções ambíguas, caminhos de execução rasos e testes frágeis que fornecem sinais de aprendizado fracos. Para superar isso, apresentamos o CLI-Universe, um motor de síntese baseado em princípios que constrói tarefas para agentes terminais. O CLI-Universe gera tarefas candidatas amostrando combinações em uma taxonomia de capacidades multidimensionais (domínio, tipo de habilidade, capacidade e pilar de engenharia), e então fundamenta cada candidata por meio de pesquisa aprofundada guiada por evidências em materiais técnicos do mundo real. Para garantir uma supervisão rigorosa, os planos validados são instanciados em ambientes Dockerizados e submetidos a um pipeline de verificação executável em múltiplos estágios, apresentando construção de testes orientada por rubrica, filtragem condicional por dicas e verificação estrita do tipo falha-para-sucesso. Ao longo de todo o pipeline, desde a geração de candidatos até a verificação, aproximadamente dois terços das candidatas são descartados, retendo apenas aquelas que são genuínas, verificáveis e desafiadoras de forma não trivial. Para validar nossa estrutura, instanciamos um conjunto de dados altamente destilado de 6.000 trajetórias chamado CLI-Universe-6K. Notavelmente, o ajuste fino do Qwen3-32B no CLI-Universe-6K alcança 33,4% no Terminal-Bench 2.0. Isso estabelece um novo estado da arte para modelos treinados em dados de código aberto com 32B parâmetros ou menos, e supera vários modelos de ordens de grandeza maiores, demonstrando a profunda eficiência de dados da síntese estruturada e de alta fidelidade.
English
While recent LLM-based terminal agents have demonstrated promising capabilities, the scarcity of high-quality, executable training data remains a critical bottleneck. Existing synthesis pipelines typically scale by retrofitting surface-level artifacts into tasks, frequently yielding ambiguous instructions, shallow execution paths, and brittle tests that provide weak learning signals. To overcome this, we introduce CLI-Universe, a principled synthesis engine that constructs terminal-agent tasks. CLI-Universe generates candidate tasks by sampling combinations across a multi-dimensional capability taxonomy (domain, skill type, capability, and engineering pillar), then grounds each candidate through evidence-guided deep research over real-world technical materials. To ensure rigorous supervision, validated blueprints are instantiated into Dockerized environments and subjected to a multi-stage executable verification pipeline featuring rubric-gated test construction, hint-conditional filtering, and strict fail-to-pass checking. Across the full pipeline, from candidate generation to verification, approximately two-thirds of candidates are discarded, retaining only those that are genuine, verifiable, and non-trivially challenging. To validate our framework, we instantiate a highly distilled dataset of 6,000 trajectories called CLI-Universe-6K. Remarkably, fine-tuning Qwen3-32B on CLI-Universe-6K achieves 33.4% on Terminal-Bench 2.0. This sets a new state-of-the-art for models trained on open-source data at or below 32B parameters, and outperforms several models an order of magnitude larger, demonstrating the profound data efficiency of structured, high-fidelity synthesis.