Automatizando o Design de Arquiteturas de Agentes Incorporados
Automating the Design of Embodied Agent Architectures
July 3, 2026
Autores: Jian Zhou, Sihao Lin, Jin Li, Shuai Fu, Gengze Zhou, Qi Wu
cs.AI
Resumo
Agentes incorporados são tipicamente construídos como composições projetadas manualmente de módulos de percepção, memória, planejamento e ação. Essa modularidade expõe um amplo espaço de design arquitetônico, mas os sistemas atuais ainda dependem da intuição do pesquisador para escolher onde as informações são armazenadas, como as observações são processadas e como as chamadas de modelo são conectadas. A Busca de Arquitetura de Agentes (AAS) automatiza esse design para agentes de domínio textual, mas não foi sistematicamente avaliada em agentes incorporados perceptuais por meio de rollouts de simulador. Estudamos essa transferência.
Apresentamos o AgentCanvas, um runtime de grafo tipado que hospeda executores incorporados como programas editáveis de nós e conexões, com execução ciente do simulador e logs em nível de episódio, e o KDLoop, um procedimento de busca de agente de codificação que percorre propostas, críticas, experimentos e destilação, com reflexão acionada após estagnações. Avaliamos três variantes de AAS em quatro executores incorporados abrangendo navegação visão-linguagem, resposta a perguntas incorporadas e manipulação condicionada por linguagem. A matriz 3x4 resultante mostra que a busca em nível de arquitetura pode produzir ganhos implementáveis e direcionais na taxa de sucesso em tarefas incorporadas, enquanto um candidato aparentemente de alta pontuação é rejeitado por conter vazamentos.
Ao mesmo tempo, os experimentos expõem restrições que são atenuadas no AAS de domínio textual: sinais de otimização podem ser mascarados pelo ruído do rollout, a busca pode ficar presa em bacias locais de edição, e a atribuição de crédito em nível de episódio emerge apenas parcialmente mesmo quando logs detalhados estão disponíveis. Esses resultados caracterizam tanto a promessa quanto os limites atuais da busca automatizada de arquitetura para agentes incorporados.
English
Embodied agents are typically built as hand-designed compositions of perception, memory, planning, and action modules. This modularity exposes a large architectural design space, but current systems still rely on researcher intuition to choose where information is stored, how observations are processed, and how model calls are connected. Agent Architecture Search (AAS) automates such design for text-domain agents, but has not been systematically evaluated on perceptual embodied agents through simulator rollouts. We study this transfer. We introduce AgentCanvas, a typed-graph runtime that hosts embodied executors as editable node-and-wire programs with simulator-aware execution and episode-level logs, and KDLoop, a coding-agent search procedure that cycles through proposal, critique, experiment, and distillation, with triggered reflection after stalls. We evaluate three AAS variants across four embodied executors spanning vision-language navigation, embodied question answering, and language-conditioned manipulation. The resulting 3x4 matrix shows that architecture-level search can produce deployable and directional success-rate gains on embodied tasks, while one apparent high-scoring candidate is rejected as leak-bearing. At the same time, the experiments expose constraints that are muted in text-domain AAS: optimization signals can be masked by rollout noise, search can become trapped in local edit basins, and episode-level credit assignment only partially emerges even when detailed logs are available. These results characterize both the promise and the current limits of automated architecture search for embodied agents.