ChatPaper.aiChatPaper

Automatisering van het ontwerp van belichaamde agentarchitecturen

Automating the Design of Embodied Agent Architectures

July 3, 2026
Auteurs: Jian Zhou, Sihao Lin, Jin Li, Shuai Fu, Gengze Zhou, Qi Wu
cs.AI

Samenvatting

Belichaamde agenten worden doorgaans gebouwd als handmatig ontworpen composities van perceptie-, geheugen-, plannings- en actiemodules. Deze modulariteit biedt een grote ontwerpruimte voor architecturen, maar huidige systemen vertrouwen nog steeds op de intuïtie van onderzoekers om te bepalen waar informatie wordt opgeslagen, hoe waarnemingen worden verwerkt en hoe modelaanroepen worden verbonden. Agent Architecture Search (AAS) automatiseert dergelijk ontwerp voor agenten in het tekstdomein, maar is niet systematisch geëvalueerd op perceptuele belichaamde agenten via simulatoruitvoeringen. Wij bestuderen deze overdracht. We introduceren AgentCanvas, een getypeerde-grafruntime die belichaamde uitvoerders host als bewerkbare knooppunt-en-verbindingsprogramma's met simulatorbewuste uitvoering en logs op afleveringsniveau, en KDLoop, een codeeragent-zoekprocedure die door voorstel, kritiek, experiment en distillatie cyclet, met geactiveerde reflectie na stilvallen. We evalueren drie AAS-varianten over vier belichaamde uitvoerders die visie-taalnavigatie, belichaamde vraagbeantwoording en taalgestuurde manipulatie bestrijken. De resulterende 3x4-matrix toont aan dat zoeken op architectuurniveau inzetbare en directionele winst in slagingspercentage kan opleveren voor belichaamde taken, terwijl één ogenschijnlijk hoog scorende kandidaat wordt afgewezen als lekkage vertonend. Tegelijkertijd brengen de experimenten beperkingen aan het licht die in AAS in het tekstdomein worden gedempt: optimalisatiesignalen kunnen worden gemaskeerd door uitvoeringsruis, zoeken kan vastlopen in lokale bewerkingsbassins, en krediettoewijzing op afleveringsniveau komt slechts gedeeltelijk tot stand, zelfs wanneer gedetailleerde logs beschikbaar zijn. Deze resultaten karakteriseren zowel de belofte als de huidige grenzen van geautomatiseerd architectuur zoeken voor belichaamde agenten.
English
Embodied agents are typically built as hand-designed compositions of perception, memory, planning, and action modules. This modularity exposes a large architectural design space, but current systems still rely on researcher intuition to choose where information is stored, how observations are processed, and how model calls are connected. Agent Architecture Search (AAS) automates such design for text-domain agents, but has not been systematically evaluated on perceptual embodied agents through simulator rollouts. We study this transfer. We introduce AgentCanvas, a typed-graph runtime that hosts embodied executors as editable node-and-wire programs with simulator-aware execution and episode-level logs, and KDLoop, a coding-agent search procedure that cycles through proposal, critique, experiment, and distillation, with triggered reflection after stalls. We evaluate three AAS variants across four embodied executors spanning vision-language navigation, embodied question answering, and language-conditioned manipulation. The resulting 3x4 matrix shows that architecture-level search can produce deployable and directional success-rate gains on embodied tasks, while one apparent high-scoring candidate is rejected as leak-bearing. At the same time, the experiments expose constraints that are muted in text-domain AAS: optimization signals can be masked by rollout noise, search can become trapped in local edit basins, and episode-level credit assignment only partially emerges even when detailed logs are available. These results characterize both the promise and the current limits of automated architecture search for embodied agents.