MemGUI-Agent: Um Agente de GUI Móvel de Longo Horizonte e Fim a Fim com Gerenciamento Proativo de Contexto
MemGUI-Agent: An End-to-End Long-Horizon Mobile GUI Agent with Proactive Context Management
June 18, 2026
Autores: Guangyi Liu, Gao Wu, Congxiao Liu, Pengxiang Zhao, Liang Liu, Mading Li, Qi Zhang, Mengyan Wang, Liang Guo, Yong Liu
cs.AI
Resumo
Agentes GUI móveis baseados em MLLM alcançaram progressos substanciais em tarefas de horizonte curto, mas continuam pouco confiáveis em tarefas de horizonte longo que exigem reter fatos intermediários ao longo de muitas etapas e transições entre aplicativos. Atribuímos essa limitação ao prompting estilo ReAct, que acumula passivamente registros de cada etapa, levando à explosão do prompt e à diluição de fatos críticos entre aplicativos. Para abordar isso, apresentamos o MemGUI-Agent, um agente GUI móvel de horizonte longo com gerenciamento proativo de contexto, operado de ponta a ponta. O MemGUI-Agent é construído sobre Context-as-Action (ConAct), que trata o gerenciamento de contexto como ações de primeira classe emitidas pela mesma política que seleciona ações de UI. Em vez de anexar passivamente o histórico, o ConAct mantém três campos de contexto estruturados: histórico de ações condensado, estado de UI condensado e registro da etapa recente, preservando fatos críticos da UI enquanto mantém o contexto compacto. Para tornar o gerenciamento proativo de contexto aprendível em diferentes escalas de modelo, construímos o MemGUI-3K, um conjunto de dados com 2.956 trajetórias e anotações completas do ConAct para treinamento supervisionado e análise offline. O treinamento de um modelo de 8B no MemGUI-3K produz o MemGUI-8B-SFT, um MemGUI-Agent de 8B que alcança o melhor desempenho entre modelos de 8B com dados abertos no MemGUI-Bench e generaliza para o benchmark MobileWorld, que está fora da distribuição. O código, os dados e os modelos treinados serão disponibilizados em https://memgui-agent.github.io/.
English
MLLM-based mobile GUI agents have made substantial progress on short-horizon tasks, yet remain unreliable on long-horizon tasks that require retaining intermediate facts across many steps and app transitions. We attribute this limitation to ReAct-style prompting, which passively accumulates per-step records, leading to prompt explosion and dilution of critical cross-app facts. To address this, we introduce MemGUI-Agent, an end-to-end long-horizon mobile GUI agent with proactive context management. MemGUI-Agent is built on Context-as-Action (ConAct), which casts context management as first-class actions emitted by the same policy that selects UI actions. Instead of passively appending history, ConAct maintains three structured context fields: folded action history, folded UI state, and recent step record, preserving critical UI facts while keeping context compact. To make proactive context management learnable across model scales, we construct MemGUI-3K, a 2,956-trajectory dataset with full ConAct annotations for supervised training and offline analysis. Training an 8B model on MemGUI-3K produces MemGUI-8B-SFT, an 8B MemGUI-Agent that achieves the best open-data 8B performance on MemGUI-Bench and generalizes to the out-of-distribution MobileWorld benchmark. Code, data, and trained models will be released at https://memgui-agent.github.io/.