ChatPaper.aiChatPaper

Shepherd: Um Substrato de Runtime que Capacita Meta-Agentes com um Traço de Execução Formalizado

Shepherd: A Runtime Substrate Empowering Meta-Agents with a Formalized Execution Trace

May 11, 2026
Autores: Simon Yu, Derek Chong, Ananjan Nandi, Dilara Soylu, Jiuding Sun, Christopher D Manning, Weiyan Shi
cs.AI

Resumo

Apresentamos o Shepherd, um modelo de programação funcional que formaliza operações de meta-agentes sobre agentes-alvo como funções, com operações centrais mecanizadas em Lean. O Shepherd registra cada interação agente-ambiente como um evento tipado em um trace de execução similar ao Git, permitindo que qualquer estado passado seja bifurcado e reproduzido. O sistema bifurca o processo do agente e seu sistema de arquivos 5 vezes mais rápido que o Docker, alcançando mais de 95% de reutilização de cache de prompt na reprodução. Demonstramos o modelo por meio de três aplicações. Primeiro, na intervenção em tempo de execução, um supervisor ao vivo aumenta as taxas de aprovação de programação em pares de 28,8% para 54,7% no CooperBench. Segundo, na meta-otimização contrafactual, a exploração por ramificações supera as linhas de base em quatro benchmarks em até 11 pontos percentuais, reduzindo o tempo de parede em até 58%. Terceiro, no treinamento Tree-RL, a bifurcação de rollouts em turnos selecionados melhora o desempenho no TerminalBench-2 de 34,2% para 39,4%. Esses resultados estabelecem o Shepherd como uma infraestrutura eficiente para programar meta-agentes. Disponibilizamos o sistema como código aberto para apoiar pesquisas futuras.
English
We introduce Shepherd, a functional programming model that formalizes meta-agent operations on target agents as functions, with core operations mechanized in Lean. Shepherd records every agent-environment interaction as a typed event in a Git-like execution trace, enabling any past state to be forked and replayed. The system forks the agent process and its filesystem 5times faster than Docker, achieving >95% prompt-cache reuse on replay. We demonstrate the model through three applications. First, in runtime intervention, a live supervisor increases pair coding pass rates from 28.8% to 54.7% on CooperBench. Second, in counterfactual meta-optimization, branching exploration outperforms baselines across four benchmarks by up to 11 points while reducing wall-clock time by up to 58%. Third, in Tree-RL training, forking rollouts at selected turns improves TerminalBench-2 performance from 34.2% to 39.4%. These results establish Shepherd as an efficient infrastructure for programming meta-agents. We open-source the system to support future research.