KnowAct-GUIClaw: Tiefes Wissen, Perfektes Handeln – Persönlicher GUI-Assistent mit sich selbst weiterentwickelndem Gedächtnis und Fertigkeit

KnowAct-GUIClaw: Know Deeply, Act Perfectly, Personal GUI Assistant with Self-Evolving Memory and Skill

July 15, 2026
Autoren: Yunxin Li, Jinchao Li, Shibo Su, Zhenran Xu, Chenrui Zhao, Tongshu Bian, Xiaoman Liang, Meishan Zhang, Baotian Hu, Min Zhang
cs.AI

Zusammenfassung

OpenClaw hat sich als führendes Agenten-Framework für die Automatisierung komplexer Aufgaben etabliert, leidet jedoch unter unzureichender plattformübergreifender GUI-Interaktionsunterstützung und einem nicht vollständig ausgebauten Selbstentwicklungsmechanismus. Diese Mängel schränken seine Anpassungsfähigkeit an verschiedene Geräte-Ökosysteme ein und verhindern Leistungsverbesserungen durch kontinuierliches Lernen aus Ausführungserfahrungen. Um diese Probleme zu lösen, schlagen wir das Paradigma „Know Deeply, Act Perfectly" für persönliche Assistenten vor, das besagt, dass gesammelte Nutzerinteraktions- und Aufgabenausführungserfahrungen direkt die Ausführungsgenauigkeit und -effizienz verbessern, indem kognitives Verständnis und operative Ausführung vereint werden. Basierend auf diesem Paradigma stellen wir KnowAct-GUIClaw vor, ein neuartiges Know-Route-Act-Reflect-Framework, das die GUI-Manipulationsdefizite von OpenClaw adressiert und dessen plattformübergreifende sowie rekursive Selbstverbesserungsbeschränkungen durchbricht. Erstens nutzt der Host-Agent angesammelte Interaktionserfahrungen und aufgabenrelevantes Wissen für die langfristige Aufgabenzerlegung und -zuweisung (Know). Zweitens wird ein pluggbarer GUI-Subagent mit einem erfahrungszuschreibbaren Gedächtnissystem (Know) und einer sich selbst entwickelnden Fähigkeitsbibliothek (Act) eingesetzt, der eine nahtlose plattformübergreifende Migration und schnelle Pfadintegration ermöglicht. Insbesondere speichert dieses Framework kontinuierlich Nutzerprofile und Feedback, um die Genauigkeit der Aufgabenzerlegung und Tool-Aufrufe zu verbessern. Umfangreiche Experimente auf Android, iOS, HarmonyOS und Windows zeigen, dass KnowAct-GUIClaw eine überlegene Effizienz, Genauigkeit und plattformübergreifende Anpassungsfähigkeit erreicht. Insbesondere erzielt der GUIClaw mit dem Open-Source-Modell Kimi-2.6 die beste Leistung (64,1 %) auf dem langfristigen MobileWorld-Benchmark und übertrifft damit alle Agenten-Frameworks und Closed-Source-Agentenmodelle wie Seed-2.0-Pro und GPT-5.5. Darüber hinaus sind das wissensbasierte Gedächtnis und die Ausführungsfähigkeiten, die von unserem Framework unterstützt werden, auf verschiedene Basismodelle übertragbar und verbessern sich mit Kimi-2.6 um 8,5 %.
English
OpenClaw has emerged as a leading agent framework for complex task automation, yet it faces insufficient cross-platform GUI interaction support and a well-built self-evolution mechanism. These flaws limit its adaptation to diverse device ecosystems and prevent performance improvements through continuous learning from execution experience. To resolve these issues, we propose the Know Deeply, Act Perfectly paradigm for personal assistants, which holds that accumulated user interaction and task-running experience directly improve execution accuracy and efficiency, unifying cognitive comprehension and operational execution. Based on this paradigm, we introduce KnowAct-GUIClaw, a novel Know-Route-Act-Reflect framework designed to address OpenClaw's GUI manipulation deficits and break through its cross-platform and recursive self-improvement constraints. First, the host agent leverages accumulated interaction experience and task-relevant knowledge for long-horizon task decomposition and allocation (Know). Second, a pluggable GUI subagent with an experience-attributable memory system (Know) and self-evolving skill library (Act), enabling seamless cross-platform migration and fast-path integration. Especially, this framework continuously stores user profiles and feedback to improve the accuracy of task decomposition and tool calls. Extensive experiments across Android, iOS, HarmonyOS and Windows show that KnowAct-GUIClaw achieves superior efficiency, accuracy and cross-platform adaptability. Especially, the GUIClaw with open-source Kimi-2.6 models achieves the best performance (64.1%) on the long-horizon MobileWorld benchmark, beating all agentical frameworks and closed-source agentical models, e.g., Seed-2.0-Pro and GPT-5.5. Additionally, the knowledgeable memory and execution skills supported by our framework are transferable across diverse base models, improving by 8.5% with Kimi-2.6.
PDF441July 17, 2026