ChatPaper.aiChatPaper

KnowAct-GUIClaw: Conheça Profundamente, Aja Perfeitamente, Assistente Pessoal de GUI com Memória e Habilidade Auto-Evolutivas

KnowAct-GUIClaw: Know Deeply, Act Perfectly, Personal GUI Assistant with Self-Evolving Memory and Skill

July 15, 2026
Autores: Yunxin Li, Jinchao Li, Shibo Su, Zhenran Xu, Chenrui Zhao, Tongshu Bian, Xiaoman Liang, Meishan Zhang, Baotian Hu, Min Zhang
cs.AI

Resumo

OpenClaw emergiu como um framework de agentes líder para automação de tarefas complexas, porém enfrenta suporte insuficiente para interação GUI multiplataforma e um mecanismo de autoevolução bem estruturado. Essas deficiências limitam sua adaptação a ecossistemas de dispositivos diversos e impedem melhorias de desempenho por meio de aprendizado contínuo a partir da experiência de execução. Para resolver esses problemas, propomos o paradigma Conhecer Profundamente, Agir Perfeitamente para assistentes pessoais, que sustenta que a experiência acumulada de interação com o usuário e de execução de tarefas melhora diretamente a precisão e eficiência da execução, unificando compreensão cognitiva e execução operacional. Com base nesse paradigma, apresentamos o KnowAct-GUIClaw, um novo framework Conhecer-Rotear-Agir-Refletir projetado para abordar as deficiências de manipulação GUI do OpenClaw e romper suas limitações de autoevolução multiplataforma e recursiva. Primeiro, o agente hospedeiro utiliza a experiência de interação acumulada e conhecimento relevante para a tarefa na decomposição e alocação de tarefas de longo horizonte (Conhecer). Segundo, um subagente GUI plugável, com um sistema de memória atribuível à experiência (Conhecer) e uma biblioteca de habilidades autoevolutiva (Agir), possibilita migração multiplataforma contínua e integração de caminho rápido. Especialmente, este framework armazena continuamente perfis de usuário e feedback para melhorar a precisão da decomposição de tarefas e das chamadas de ferramentas. Experimentos extensivos em Android, iOS, HarmonyOS e Windows mostram que o KnowAct-GUIClaw atinge eficiência, precisão e adaptabilidade multiplataforma superiores. Em particular, o GUIClaw com os modelos open-source Kimi-2,6 alcança o melhor desempenho (64,1%) no benchmark MobileWorld de longo horizonte, superando todos os frameworks agentíacos e modelos agentíacos de código fechado, como Seed-2.0-Pro e GPT-5.5. Além disso, a memória baseada em conhecimento e as habilidades de execução suportadas pelo nosso framework são transferíveis entre diversos modelos base, melhorando em 8,5% com Kimi-2,6.
English
OpenClaw has emerged as a leading agent framework for complex task automation, yet it faces insufficient cross-platform GUI interaction support and a well-built self-evolution mechanism. These flaws limit its adaptation to diverse device ecosystems and prevent performance improvements through continuous learning from execution experience. To resolve these issues, we propose the Know Deeply, Act Perfectly paradigm for personal assistants, which holds that accumulated user interaction and task-running experience directly improve execution accuracy and efficiency, unifying cognitive comprehension and operational execution. Based on this paradigm, we introduce KnowAct-GUIClaw, a novel Know-Route-Act-Reflect framework designed to address OpenClaw's GUI manipulation deficits and break through its cross-platform and recursive self-improvement constraints. First, the host agent leverages accumulated interaction experience and task-relevant knowledge for long-horizon task decomposition and allocation (Know). Second, a pluggable GUI subagent with an experience-attributable memory system (Know) and self-evolving skill library (Act), enabling seamless cross-platform migration and fast-path integration. Especially, this framework continuously stores user profiles and feedback to improve the accuracy of task decomposition and tool calls. Extensive experiments across Android, iOS, HarmonyOS and Windows show that KnowAct-GUIClaw achieves superior efficiency, accuracy and cross-platform adaptability. Especially, the GUIClaw with open-source Kimi-2.6 models achieves the best performance (64.1%) on the long-horizon MobileWorld benchmark, beating all agentical frameworks and closed-source agentical models, e.g., Seed-2.0-Pro and GPT-5.5. Additionally, the knowledgeable memory and execution skills supported by our framework are transferable across diverse base models, improving by 8.5% with Kimi-2.6.