MobileForge : Adaptation sans annotation pour agents d'interface utilisateur mobile avec optimisation de politique guidée par rétroaction hiérarchique
MobileForge: Annotation-Free Adaptation for Mobile GUI Agents with Hierarchical Feedback-Guided Policy Optimization
June 18, 2026
Auteurs: Guangyi Liu, Pengxiang Zhao, Gao Wu, Yiwen Yin, Mading Li, Liang Liu, Congxiao Liu, Zhang Qi, Mengyan Wang, Liang Guo, Yong Liu
cs.AI
Résumé
Les agents GUI mobiles basés sur MLLM ont réalisé des progrès substantiels dans la compréhension des interfaces utilisateur et l'exécution d'actions, mais leur adaptation à des applications cibles réelles reste coûteuse car les applications mobiles sont nombreuses, fréquemment mises à jour et difficiles à couvrir avec des tâches, des démonstrations ou des étiquettes de récompense rédigées par des humains. Les méthodes d'apprentissage GUI sans annotation existantes réduisent la supervision manuelle, mais manquent d'un substrat unifié reliant l'exploration des applications cibles, l'exploration de curriculum, l'exécution de rollouts et le retour d'information, tandis que l'optimisation de politique repose souvent sur des rollouts isolés et des récompenses grossières difficiles à convertir en signaux d'amélioration fiables. Nous présentons MobileForge, un système d'adaptation sans annotation pour les agents GUI mobiles. MobileForge se compose de MobileGym, qui ancre la génération de tâches et l'évaluation des rollouts dans l'interaction réelle avec les applications mobiles, et de l'Optimisation de Politique Guidée par Retour Hiérarchique (HiFPO), qui transforme les résultats de trajectoires, le retour de processus au niveau des étapes et les indications correctives en mises à jour GRPO contextuelles au niveau des étapes. En utilisant uniquement des données d'adaptation sans annotation générées automatiquement, MobileForge adapte Qwen3-VL-8B à 67,2% de Pass@3 sur AndroidWorld, proche du modèle de base GUI-Owl-1.5-8B spécialisé GUI avec données fermées à 69,0%. Le ForgeOwl-8B adapté par MobileForge atteint en outre 77,6% de Pass@3 sur AndroidWorld et 41,0% de succès sur la partition GUI-only de MobileWorld hors domaine, établissant l'agent GUI mobile open-data le plus performant dans notre évaluation. Le code, les données et les modèles entraînés seront publiés sur https://mobile-forge.github.io/.
English
MLLM-based mobile GUI agents have made substantial progress in UI understanding and action execution, but adapting them to real target apps remains costly because mobile apps are numerous, frequently updated, and hard to cover with human-written tasks, demonstrations, or reward labels. Existing annotation-free GUI learning reduces manual supervision, yet lacks a unified substrate connecting target-app exploration, curriculum mining, rollout execution, and feedback, while policy optimization often relies on isolated rollouts and coarse rewards that are hard to convert into reliable improvement signals. We present MobileForge, an annotation-free adaptation system for mobile GUI agents. MobileForge consists of MobileGym, which grounds task generation and rollout evaluation in real mobile app interaction, and Hierarchical Feedback-Guided Policy Optimization (HiFPO), which turns trajectory outcomes, step-level process feedback, and corrective hints into hint-contextualized step-level GRPO updates. Using only automatically generated annotation-free adaptation data, MobileForge adapts Qwen3-VL-8B to 67.2% Pass@3 on AndroidWorld, close to the closed-data GUI-specialized GUI-Owl-1.5-8B base model at 69.0%. The MobileForge-adapted ForgeOwl-8B further reaches 77.6% Pass@3 on AndroidWorld and 41.0% success on the out-of-domain MobileWorld GUI-only split, establishing the strongest open-data mobile GUI agent in our evaluation. Code, data, and trained models will be released at https://mobile-forge.github.io/.