ChatPaper.aiChatPaper

Automatización del Diseño de Arquitecturas de Agentes Encarnados

Automating the Design of Embodied Agent Architectures

July 3, 2026
Autores: Jian Zhou, Sihao Lin, Jin Li, Shuai Fu, Gengze Zhou, Qi Wu
cs.AI

Resumen

Los agentes encarnados se construyen típicamente como composiciones diseñadas a mano de módulos de percepción, memoria, planificación y acción. Esta modularidad expone un amplio espacio de diseño arquitectónico, pero los sistemas actuales aún dependen de la intuición del investigador para elegir dónde se almacena la información, cómo se procesan las observaciones y cómo se conectan las llamadas a los modelos. La Búsqueda de Arquitectura de Agentes (AAS) automatiza dicho diseño para agentes en dominio textual, pero no ha sido evaluada sistemáticamente en agentes encarnados perceptivos mediante ejecuciones de simuladores. Estudiamos esta transferencia. Presentamos AgentCanvas, un tiempo de ejecución de grafo tipado que aloja ejecutores encarnados como programas editables de nodos y cables con ejecución consciente del simulador y registros a nivel de episodio, y KDLoop, un procedimiento de búsqueda de agente de codificación que recorre propuesta, crítica, experimento y destilación, con reflexión activada tras estancamientos. Evaluamos tres variantes de AAS en cuatro ejecutores encarnados que abarcan navegación visual-lingüística, respuesta a preguntas encarnada y manipulación condicionada por lenguaje. La matriz 3x4 resultante muestra que la búsqueda a nivel de arquitectura puede producir mejoras implementables y direccionales en la tasa de éxito en tareas encarnadas, mientras que un candidato aparentemente de alto puntaje es rechazado por presentar fugas. Al mismo tiempo, los experimentos revelan limitaciones que están amortiguadas en AAS en dominio textual: las señales de optimización pueden ser enmascaradas por el ruido de ejecución, la búsqueda puede quedar atrapada en cuencas de edición local, y la asignación de crédito a nivel de episodio solo emerge parcialmente incluso cuando están disponibles registros detallados. Estos resultados caracterizan tanto la promesa como los límites actuales de la búsqueda automatizada de arquitecturas para agentes encarnados.
English
Embodied agents are typically built as hand-designed compositions of perception, memory, planning, and action modules. This modularity exposes a large architectural design space, but current systems still rely on researcher intuition to choose where information is stored, how observations are processed, and how model calls are connected. Agent Architecture Search (AAS) automates such design for text-domain agents, but has not been systematically evaluated on perceptual embodied agents through simulator rollouts. We study this transfer. We introduce AgentCanvas, a typed-graph runtime that hosts embodied executors as editable node-and-wire programs with simulator-aware execution and episode-level logs, and KDLoop, a coding-agent search procedure that cycles through proposal, critique, experiment, and distillation, with triggered reflection after stalls. We evaluate three AAS variants across four embodied executors spanning vision-language navigation, embodied question answering, and language-conditioned manipulation. The resulting 3x4 matrix shows that architecture-level search can produce deployable and directional success-rate gains on embodied tasks, while one apparent high-scoring candidate is rejected as leak-bearing. At the same time, the experiments expose constraints that are muted in text-domain AAS: optimization signals can be masked by rollout noise, search can become trapped in local edit basins, and episode-level credit assignment only partially emerges even when detailed logs are available. These results characterize both the promise and the current limits of automated architecture search for embodied agents.