KnowAct-GUIClaw: познавай глубоко, действуй безупречно — персональный GUI-ассистент с саморазвивающейся памятью и навыками
KnowAct-GUIClaw: Know Deeply, Act Perfectly, Personal GUI Assistant with Self-Evolving Memory and Skill
July 15, 2026
Авторы: Yunxin Li, Jinchao Li, Shibo Su, Zhenran Xu, Chenrui Zhao, Tongshu Bian, Xiaoman Liang, Meishan Zhang, Baotian Hu, Min Zhang
cs.AI
Аннотация
OpenClaw стал ведущим агентным фреймворком для автоматизации сложных задач, однако ему не хватает достаточной поддержки кроссплатформенного GUI-взаимодействия и хорошо развитого механизма самоэволюции. Эти недостатки ограничивают его адаптацию к разнообразным экосистемам устройств и препятствуют повышению производительности за счёт непрерывного обучения на основе опыта выполнения. Для решения этих проблем мы предлагаем парадигму «Познавай глубоко, действуй идеально» для персональных ассистентов, согласно которой накопленный опыт взаимодействия с пользователем и выполнения задач напрямую повышает точность и эффективность действий, объединяя когнитивное понимание и операционное выполнение. Основываясь на этой парадигме, мы представляем KnowAct-GUIClaw — новую структуру «Знай-Маршрут-Действуй-Размышляй», предназначенную для устранения недостатков OpenClaw в манипуляции GUI и преодоления ограничений кроссплатформенности и рекурсивного самосовершенствования. Во-первых, главный агент использует накопленный опыт взаимодействия и знания, относящиеся к задаче, для долгосрочного разложения и распределения задач (Знай). Во-вторых, подключаемый GUI-субагент с системой памяти на основе атрибуции опыта (Знай) и саморазвивающейся библиотекой навыков (Действуй), что обеспечивает seamless-миграцию между платформами и интеграцию по быстрому пути. В частности, этот фреймворк непрерывно сохраняет профили пользователей и обратную связь для повышения точности разложения задач и вызова инструментов. Обширные эксперименты на Android, iOS, HarmonyOS и Windows показывают, что KnowAct-GUIClaw достигает превосходной эффективности, точности и кроссплатформенной адаптируемости. В частности, GUIClaw с открытыми моделями Kimi-2.6 демонстрирует наилучшую производительность (64,1%) на бенчмарке MobileWorld для долгосрочных задач, превосходя все агентные фреймворки и закрытые агентные модели, такие как Seed-2.0-Pro и GPT-5.5. Кроме того, поддерживаемые нашим фреймворком осведомленная память и исполнительные навыки переносимы между различными базовыми моделями, улучшая показатели на 8,5% при использовании Kimi-2.6.
English
OpenClaw has emerged as a leading agent framework for complex task automation, yet it faces insufficient cross-platform GUI interaction support and a well-built self-evolution mechanism. These flaws limit its adaptation to diverse device ecosystems and prevent performance improvements through continuous learning from execution experience. To resolve these issues, we propose the Know Deeply, Act Perfectly paradigm for personal assistants, which holds that accumulated user interaction and task-running experience directly improve execution accuracy and efficiency, unifying cognitive comprehension and operational execution. Based on this paradigm, we introduce KnowAct-GUIClaw, a novel Know-Route-Act-Reflect framework designed to address OpenClaw's GUI manipulation deficits and break through its cross-platform and recursive self-improvement constraints. First, the host agent leverages accumulated interaction experience and task-relevant knowledge for long-horizon task decomposition and allocation (Know). Second, a pluggable GUI subagent with an experience-attributable memory system (Know) and self-evolving skill library (Act), enabling seamless cross-platform migration and fast-path integration. Especially, this framework continuously stores user profiles and feedback to improve the accuracy of task decomposition and tool calls. Extensive experiments across Android, iOS, HarmonyOS and Windows show that KnowAct-GUIClaw achieves superior efficiency, accuracy and cross-platform adaptability. Especially, the GUIClaw with open-source Kimi-2.6 models achieves the best performance (64.1%) on the long-horizon MobileWorld benchmark, beating all agentical frameworks and closed-source agentical models, e.g., Seed-2.0-Pro and GPT-5.5. Additionally, the knowledgeable memory and execution skills supported by our framework are transferable across diverse base models, improving by 8.5% with Kimi-2.6.