MobileForge: Adaptação sem Anotações para Agentes de GUI Móvel com Otimização de Política Guiada por Feedback Hierárquico
MobileForge: Annotation-Free Adaptation for Mobile GUI Agents with Hierarchical Feedback-Guided Policy Optimization
June 18, 2026
Autores: Guangyi Liu, Pengxiang Zhao, Gao Wu, Yiwen Yin, Mading Li, Liang Liu, Congxiao Liu, Zhang Qi, Mengyan Wang, Liang Guo, Yong Liu
cs.AI
Resumo
Agentes de GUI móvel baseados em MLLM fizeram progressos substanciais na compreensão de IU e execução de ações, mas adaptá-los a aplicativos reais continua caro, pois os aplicativos móveis são numerosos, frequentemente atualizados e difíceis de cobrir com tarefas escritas por humanos, demonstrações ou rótulos de recompensa. A aprendizagem de GUI sem anotação existente reduz a supervisão manual, mas carece de um substrato unificado conectando exploração de aplicativos-alvo, mineração de currículo, execução de rollouts e feedback, enquanto a otimização de políticas frequentemente depende de rollouts isolados e recompensas grosseiras difíceis de converter em sinais de melhoria confiáveis. Apresentamos o MobileForge, um sistema de adaptação sem anotação para agentes de GUI móvel. O MobileForge consiste no MobileGym, que fundamenta a geração de tarefas e a avaliação de rollouts na interação real com aplicativos móveis, e na Otimização de Política Guiada por Feedback Hierárquico (HiFPO), que transforma resultados de trajetórias, feedback de processo no nível de passo e dicas corretivas em atualizações GRPO no nível de passo contextualizadas por dicas. Usando apenas dados de adaptação sem anotação gerados automaticamente, o MobileForge adapta o Qwen3-VL-8B para 67,2% Pass@3 no AndroidWorld, próximo ao modelo base GUI-Owl-1.5-8B especializado em GUI com dados fechados, que atinge 69,0%. O ForgeOwl-8B adaptado pelo MobileForge alcança ainda 77,6% Pass@3 no AndroidWorld e 41,0% de sucesso na divisão GUI-only do MobileWorld fora do domínio, estabelecendo o agente de GUI móvel com dados abertos mais forte em nossa avaliação. Código, dados e modelos treinados serão disponibilizados em https://mobile-forge.github.io/.
English
MLLM-based mobile GUI agents have made substantial progress in UI understanding and action execution, but adapting them to real target apps remains costly because mobile apps are numerous, frequently updated, and hard to cover with human-written tasks, demonstrations, or reward labels. Existing annotation-free GUI learning reduces manual supervision, yet lacks a unified substrate connecting target-app exploration, curriculum mining, rollout execution, and feedback, while policy optimization often relies on isolated rollouts and coarse rewards that are hard to convert into reliable improvement signals. We present MobileForge, an annotation-free adaptation system for mobile GUI agents. MobileForge consists of MobileGym, which grounds task generation and rollout evaluation in real mobile app interaction, and Hierarchical Feedback-Guided Policy Optimization (HiFPO), which turns trajectory outcomes, step-level process feedback, and corrective hints into hint-contextualized step-level GRPO updates. Using only automatically generated annotation-free adaptation data, MobileForge adapts Qwen3-VL-8B to 67.2% Pass@3 on AndroidWorld, close to the closed-data GUI-specialized GUI-Owl-1.5-8B base model at 69.0%. The MobileForge-adapted ForgeOwl-8B further reaches 77.6% Pass@3 on AndroidWorld and 41.0% success on the out-of-domain MobileWorld GUI-only split, establishing the strongest open-data mobile GUI agent in our evaluation. Code, data, and trained models will be released at https://mobile-forge.github.io/.