ChatPaper.aiChatPaper

Автоматизация проектирования архитектур воплощенных агентов

Automating the Design of Embodied Agent Architectures

July 3, 2026
Авторы: Jian Zhou, Sihao Lin, Jin Li, Shuai Fu, Gengze Zhou, Qi Wu
cs.AI

Аннотация

Воплощенные агенты обычно создаются как вручную разработанные композиции модулей восприятия, памяти, планирования и действий. Эта модульность открывает большое пространство для архитектурного проектирования, однако современные системы по-прежнему полагаются на интуицию исследователя при выборе того, где хранить информацию, как обрабатывать наблюдения и как соединять вызовы моделей. Поиск архитектуры агентов (AAS) автоматизирует такое проектирование для агентов в текстовой области, но не был систематически оценен на воспринимающих воплощенных агентах с помощью развертываний в симуляторе. Мы изучаем этот перенос. Мы представляем AgentCanvas — типизированную графовую среду выполнения, которая размещает воплощенные исполнители в виде редактируемых программ из узлов и связей с исполнением, учитывающим симулятор, и журналами на уровне эпизодов, а также KDLoop — процедуру поиска с помощью агента-кодировщика, которая циклически проходит через предложение, критику, эксперимент и дистилляцию, с инициированной рефлексией после задержек. Мы оцениваем три варианта AAS на четырех воплощенных исполнителях, охватывающих навигацию на основе зрения и языка, воплощенный ответ на вопросы и манипуляции по языковой инструкции. Полученная матрица 3×4 показывает, что поиск на уровне архитектуры может дать развертываемые и направленные приросты показателя успеха на воплощенных задачах, в то время как один очевидный кандидат с высокими показателями отвергается как содержащий утечку. В то же время эксперименты выявляют ограничения, которые сглажены в текстовом AAS: сигналы оптимизации могут маскироваться шумом развертывания, поиск может застревать в локальных бассейнах редактирования, а присвоение вклада на уровне эпизодов проявляется лишь частично, даже при наличии подробных журналов. Эти результаты характеризуют как перспективы, так и текущие ограничения автоматизированного поиска архитектуры для воплощенных агентов.
English
Embodied agents are typically built as hand-designed compositions of perception, memory, planning, and action modules. This modularity exposes a large architectural design space, but current systems still rely on researcher intuition to choose where information is stored, how observations are processed, and how model calls are connected. Agent Architecture Search (AAS) automates such design for text-domain agents, but has not been systematically evaluated on perceptual embodied agents through simulator rollouts. We study this transfer. We introduce AgentCanvas, a typed-graph runtime that hosts embodied executors as editable node-and-wire programs with simulator-aware execution and episode-level logs, and KDLoop, a coding-agent search procedure that cycles through proposal, critique, experiment, and distillation, with triggered reflection after stalls. We evaluate three AAS variants across four embodied executors spanning vision-language navigation, embodied question answering, and language-conditioned manipulation. The resulting 3x4 matrix shows that architecture-level search can produce deployable and directional success-rate gains on embodied tasks, while one apparent high-scoring candidate is rejected as leak-bearing. At the same time, the experiments expose constraints that are muted in text-domain AAS: optimization signals can be masked by rollout noise, search can become trapped in local edit basins, and episode-level credit assignment only partially emerges even when detailed logs are available. These results characterize both the promise and the current limits of automated architecture search for embodied agents.