MemGUI-Agent : un agent d'interface graphique mobile de bout en bout à long terme avec gestion proactive du contexte
MemGUI-Agent: An End-to-End Long-Horizon Mobile GUI Agent with Proactive Context Management
June 18, 2026
Auteurs: Guangyi Liu, Gao Wu, Congxiao Liu, Pengxiang Zhao, Liang Liu, Mading Li, Qi Zhang, Mengyan Wang, Liang Guo, Yong Liu
cs.AI
Résumé
Les agents GUI mobiles basés sur MLLM ont réalisé des progrès substantiels dans les tâches à court horizon, mais restent peu fiables dans les tâches à long horizon qui nécessitent de retenir des faits intermédiaires à travers de nombreuses étapes et transitions entre applications. Nous attribuons cette limitation à l'amorçage de type ReAct, qui accumule passivement les enregistrements par étape, entraînant une explosion de l'amorce et une dilution des faits critiques inter-applications. Pour y remédier, nous introduisons MemGUI-Agent, un agent GUI mobile à long horizon de bout en bout avec gestion proactive du contexte. MemGUI-Agent repose sur Contexte comme Action (ConAct), qui considère la gestion du contexte comme des actions de première classe émises par la même politique qui sélectionne les actions d'interface utilisateur. Au lieu d'ajouter passivement l'historique, ConAct maintient trois champs de contexte structurés : l'historique d'actions condensé, l'état d'interface utilisateur condensé et l'enregistrement des étapes récentes, préservant les faits UI critiques tout en gardant le contexte compact. Pour rendre la gestion proactive du contexte apprenable à travers les échelles de modèles, nous construisons MemGUI-3K, un ensemble de données de 2 956 trajectoires avec des annotations ConAct complètes pour l'apprentissage supervisé et l'analyse hors ligne. L'entraînement d'un modèle 8B sur MemGUI-3K produit MemGUI-8B-SFT, un agent MemGUI 8B qui atteint la meilleure performance 8B en données ouvertes sur MemGUI-Bench et se généralise au benchmark MobileWorld hors distribution. Le code, les données et les modèles entraînés seront publiés à l'adresse https://memgui-agent.github.io/.
English
MLLM-based mobile GUI agents have made substantial progress on short-horizon tasks, yet remain unreliable on long-horizon tasks that require retaining intermediate facts across many steps and app transitions. We attribute this limitation to ReAct-style prompting, which passively accumulates per-step records, leading to prompt explosion and dilution of critical cross-app facts. To address this, we introduce MemGUI-Agent, an end-to-end long-horizon mobile GUI agent with proactive context management. MemGUI-Agent is built on Context-as-Action (ConAct), which casts context management as first-class actions emitted by the same policy that selects UI actions. Instead of passively appending history, ConAct maintains three structured context fields: folded action history, folded UI state, and recent step record, preserving critical UI facts while keeping context compact. To make proactive context management learnable across model scales, we construct MemGUI-3K, a 2,956-trajectory dataset with full ConAct annotations for supervised training and offline analysis. Training an 8B model on MemGUI-3K produces MemGUI-8B-SFT, an 8B MemGUI-Agent that achieves the best open-data 8B performance on MemGUI-Bench and generalizes to the out-of-distribution MobileWorld benchmark. Code, data, and trained models will be released at https://memgui-agent.github.io/.