KnowAct-GUIClaw : Connaître en profondeur, Agir parfaitement, Assistant GUI personnel doté d'une mémoire et de compétences auto-évolutives

KnowAct-GUIClaw: Know Deeply, Act Perfectly, Personal GUI Assistant with Self-Evolving Memory and Skill

July 15, 2026
Auteurs: Yunxin Li, Jinchao Li, Shibo Su, Zhenran Xu, Chenrui Zhao, Tongshu Bian, Xiaoman Liang, Meishan Zhang, Baotian Hu, Min Zhang
cs.AI

Résumé

OpenClaw est devenu un cadre d'agents de premier plan pour l'automatisation de tâches complexes, mais il souffre d'un support insuffisant pour l'interaction GUI multiplateforme et d'un mécanisme d'auto-évolution mal conçu. Ces lacunes limitent son adaptation à des écosystèmes d'appareils diversifiés et empêchent l'amélioration des performances par l'apprentissage continu à partir de l'expérience d'exécution. Pour résoudre ces problèmes, nous proposons le paradigme Savoir Profondément, Agir Parfaitement pour les assistants personnels, selon lequel l'accumulation d'interactions utilisateur et d'expérience d'exécution de tâches améliore directement la précision et l'efficacité d'exécution, unifiant la compréhension cognitive et l'exécution opérationnelle. Sur la base de ce paradigme, nous introduisons KnowAct-GUIClaw, un nouveau cadre Savoir-Route-Agir-Réfléchir conçu pour remédier aux déficits de manipulation GUI d'OpenClaw et franchir ses limites de portabilité multiplateforme et d'auto-amélioration récursive. Premièrement, l'agent hôte exploite l'expérience d'interaction accumulée et les connaissances liées aux tâches pour la décomposition et l'allocation de tâches à long horizon (Savoir). Deuxièmement, un sous-agent GUI enfichable doté d'un système de mémoire attribuable à l'expérience (Savoir) et d'une bibliothèque de compétences auto-évolutive (Agir), permettant une migration multiplateforme transparente et une intégration de chemins rapides. Notamment, ce cadre stocke en continu les profils utilisateur et les retours pour améliorer la précision de la décomposition des tâches et des appels d'outils. Des expériences approfondies sur Android, iOS, HarmonyOS et Windows montrent que KnowAct-GUIClaw atteint une efficacité, une précision et une adaptabilité multiplateforme supérieures. En particulier, GUIClaw avec les modèles open-source Kimi-2.6 obtient la meilleure performance (64,1%) sur le benchmark à long horizon MobileWorld, surpassant tous les cadres agentiels et modèles agentiels propriétaires, par exemple Seed-2.0-Pro et GPT-5.5. De plus, la mémoire savante et les compétences d'exécution supportées par notre cadre sont transférables entre divers modèles de base, avec une amélioration de 8,5% avec Kimi-2.6.
English
OpenClaw has emerged as a leading agent framework for complex task automation, yet it faces insufficient cross-platform GUI interaction support and a well-built self-evolution mechanism. These flaws limit its adaptation to diverse device ecosystems and prevent performance improvements through continuous learning from execution experience. To resolve these issues, we propose the Know Deeply, Act Perfectly paradigm for personal assistants, which holds that accumulated user interaction and task-running experience directly improve execution accuracy and efficiency, unifying cognitive comprehension and operational execution. Based on this paradigm, we introduce KnowAct-GUIClaw, a novel Know-Route-Act-Reflect framework designed to address OpenClaw's GUI manipulation deficits and break through its cross-platform and recursive self-improvement constraints. First, the host agent leverages accumulated interaction experience and task-relevant knowledge for long-horizon task decomposition and allocation (Know). Second, a pluggable GUI subagent with an experience-attributable memory system (Know) and self-evolving skill library (Act), enabling seamless cross-platform migration and fast-path integration. Especially, this framework continuously stores user profiles and feedback to improve the accuracy of task decomposition and tool calls. Extensive experiments across Android, iOS, HarmonyOS and Windows show that KnowAct-GUIClaw achieves superior efficiency, accuracy and cross-platform adaptability. Especially, the GUIClaw with open-source Kimi-2.6 models achieves the best performance (64.1%) on the long-horizon MobileWorld benchmark, beating all agentical frameworks and closed-source agentical models, e.g., Seed-2.0-Pro and GPT-5.5. Additionally, the knowledgeable memory and execution skills supported by our framework are transferable across diverse base models, improving by 8.5% with Kimi-2.6.
PDF441July 17, 2026