Automatisation de la conception d'architectures d'agents incarnés
Automating the Design of Embodied Agent Architectures
July 3, 2026
Auteurs: Jian Zhou, Sihao Lin, Jin Li, Shuai Fu, Gengze Zhou, Qi Wu
cs.AI
Résumé
Les agents incarnés sont généralement construits comme des compositions conçues à la main de modules de perception, mémoire, planification et action. Cette modularité expose un vaste espace de conception architecturale, mais les systèmes actuels reposent encore sur l'intuition du chercheur pour choisir où stocker les informations, comment traiter les observations et comment connecter les appels de modèle. La recherche d'architecture d'agent (AAS) automatise une telle conception pour les agents textuels, mais n'a pas été systématiquement évaluée sur des agents incarnés perceptuels via des déploiements en simulateur. Nous étudions ce transfert. Nous introduisons AgentCanvas, un environnement d'exécution à graphe typé qui héberge des exécuteurs incarnés sous forme de programmes modifiables nœuds-et-fils avec une exécution consciente du simulateur et des journaux au niveau des épisodes, ainsi que KDLoop, une procédure de recherche par agent de codage qui alterne proposition, critique, expérience et distillation, avec une réflexion déclenchée après des blocages. Nous évaluons trois variantes d'AAS sur quatre exécuteurs incarnés couvrant la navigation vision-langage, le question-réponse incarné et la manipulation conditionnée par le langage. La matrice 3x4 qui en résulte montre que la recherche au niveau architectural peut produire des gains déployables et directionnels en taux de réussite sur des tâches incarnées, tandis qu'un candidat apparemment très performant est rejeté comme porteur de fuite. Dans le même temps, les expériences révèlent des contraintes qui sont atténuées dans l'AAS textuel : les signaux d'optimisation peuvent être masqués par le bruit de déploiement, la recherche peut se retrouver piégée dans des bassins d'édition locaux, et l'assignation de crédit au niveau des épisodes n'émerge que partiellement, même lorsque des journaux détaillés sont disponibles. Ces résultats caractérisent à la fois les promesses et les limites actuelles de la recherche automatisée d'architecture pour les agents incarnés.
English
Embodied agents are typically built as hand-designed compositions of perception, memory, planning, and action modules. This modularity exposes a large architectural design space, but current systems still rely on researcher intuition to choose where information is stored, how observations are processed, and how model calls are connected. Agent Architecture Search (AAS) automates such design for text-domain agents, but has not been systematically evaluated on perceptual embodied agents through simulator rollouts. We study this transfer. We introduce AgentCanvas, a typed-graph runtime that hosts embodied executors as editable node-and-wire programs with simulator-aware execution and episode-level logs, and KDLoop, a coding-agent search procedure that cycles through proposal, critique, experiment, and distillation, with triggered reflection after stalls. We evaluate three AAS variants across four embodied executors spanning vision-language navigation, embodied question answering, and language-conditioned manipulation. The resulting 3x4 matrix shows that architecture-level search can produce deployable and directional success-rate gains on embodied tasks, while one apparent high-scoring candidate is rejected as leak-bearing. At the same time, the experiments expose constraints that are muted in text-domain AAS: optimization signals can be masked by rollout noise, search can become trapped in local edit basins, and episode-level credit assignment only partially emerges even when detailed logs are available. These results characterize both the promise and the current limits of automated architecture search for embodied agents.