KnowAct-GUIClaw: Conoce profundamente, actúa perfectamente, asistente personal de GUI con memoria y habilidad auto-evolutivas

KnowAct-GUIClaw: Know Deeply, Act Perfectly, Personal GUI Assistant with Self-Evolving Memory and Skill

July 15, 2026
Autores: Yunxin Li, Jinchao Li, Shibo Su, Zhenran Xu, Chenrui Zhao, Tongshu Bian, Xiaoman Liang, Meishan Zhang, Baotian Hu, Min Zhang
cs.AI

Resumen

OpenClaw ha emergido como un marco de agentes líder para la automatización de tareas complejas, pero enfrenta un soporte insuficiente para la interacción multiplataforma con interfaces gráficas de usuario (GUI) y una carencia de un mecanismo de autoevolución bien consolidado. Estas deficiencias limitan su adaptación a ecosistemas de dispositivos diversos e impiden mejoras en el rendimiento mediante el aprendizaje continuo a partir de la experiencia de ejecución. Para resolver estos problemas, proponemos el paradigma Conocer Profundamente, Actuar Perfectamente para asistentes personales, que sostiene que la experiencia acumulada de interacción con el usuario y de ejecución de tareas mejora directamente la precisión y eficiencia de la ejecución, unificando la comprensión cognitiva y la ejecución operativa. Basándonos en este paradigma, presentamos KnowAct-GUIClaw, un novedoso marco Conocer-Ruta-Actuar-Reflexionar diseñado para abordar las deficiencias de manipulación de GUI de OpenClaw y superar sus limitaciones en cuanto a mejora recursiva y multiplataforma. En primer lugar, el agente anfitrión aprovecha la experiencia de interacción acumulada y el conocimiento relevante de la tarea para la descomposición y asignación de tareas a largo plazo (Conocer). En segundo lugar, un subagente GUI conectable con un sistema de memoria atribuible a la experiencia (Conocer) y una biblioteca de habilidades autoevolutiva (Actuar) permite una migración multiplataforma sin fisuras y una integración de vía rápida. En particular, este marco almacena continuamente perfiles de usuario y retroalimentación para mejorar la precisión de la descomposición de tareas y las llamadas a herramientas. Experimentos exhaustivos en Android, iOS, HarmonyOS y Windows muestran que KnowAct-GUIClaw logra una eficiencia, precisión y adaptabilidad multiplataforma superiores. Especialmente, el GUIClaw con el modelo de código abierto Kimi-2.6 alcanza el mejor rendimiento (64.1%) en el benchmark de larga duración MobileWorld, superando a todos los marcos de agentes y modelos de agentes de código cerrado, como Seed-2.0-Pro y GPT-5.5. Además, la memoria basada en conocimiento y las habilidades de ejecución respaldadas por nuestro marco son transferibles entre diversos modelos base, mejorando en un 8.5% con Kimi-2.6.
English
OpenClaw has emerged as a leading agent framework for complex task automation, yet it faces insufficient cross-platform GUI interaction support and a well-built self-evolution mechanism. These flaws limit its adaptation to diverse device ecosystems and prevent performance improvements through continuous learning from execution experience. To resolve these issues, we propose the Know Deeply, Act Perfectly paradigm for personal assistants, which holds that accumulated user interaction and task-running experience directly improve execution accuracy and efficiency, unifying cognitive comprehension and operational execution. Based on this paradigm, we introduce KnowAct-GUIClaw, a novel Know-Route-Act-Reflect framework designed to address OpenClaw's GUI manipulation deficits and break through its cross-platform and recursive self-improvement constraints. First, the host agent leverages accumulated interaction experience and task-relevant knowledge for long-horizon task decomposition and allocation (Know). Second, a pluggable GUI subagent with an experience-attributable memory system (Know) and self-evolving skill library (Act), enabling seamless cross-platform migration and fast-path integration. Especially, this framework continuously stores user profiles and feedback to improve the accuracy of task decomposition and tool calls. Extensive experiments across Android, iOS, HarmonyOS and Windows show that KnowAct-GUIClaw achieves superior efficiency, accuracy and cross-platform adaptability. Especially, the GUIClaw with open-source Kimi-2.6 models achieves the best performance (64.1%) on the long-horizon MobileWorld benchmark, beating all agentical frameworks and closed-source agentical models, e.g., Seed-2.0-Pro and GPT-5.5. Additionally, the knowledgeable memory and execution skills supported by our framework are transferable across diverse base models, improving by 8.5% with Kimi-2.6.
PDF441July 17, 2026