ChatPaper.aiChatPaper

UI-MOPD: Destilação On-Policy Multiplataforma para Aprendizagem Contínua de Agentes GUI

UI-MOPD: Multi-Platform On-Policy Distillation for Continual GUI Agent Learning

July 5, 2026
Autores: Niu Lian, Alan Chen, Zhehao Yu, Chengzhen Duan, Fazhan Liu, Hui Liu, Pei Fu, Jian Luan, Yaowei Wang, Shu-Tao Xia, Jinpeng Wang
cs.AI

Resumo

Avanços recentes em modelos fundamentais multimodais e sistemas agentes têm impulsionado os agentes GUI da execução de tarefas em uma única plataforma para a interação multiplataforma. No entanto, construir agentes GUI multiplataforma continua sendo um desafio. Por um lado, trajetórias de interação multiplataforma de alta qualidade e executáveis ainda são escassas, e os dados existentes frequentemente sofrem de cobertura limitada de plataformas. Por outro lado, diferentes plataformas exibem convenções de interação distintas, tornando o treinamento conjunto ou contínuo propenso à mistura de padrões comportamentais, degradação de capacidades específicas da plataforma e esquecimento catastrófico. Para enfrentar esses desafios, construímos o Uni-GUI, um conjunto de dados de interação GUI multiplataforma de alta qualidade, e propomos o UI-MOPD, o primeiro método que incorpora destilação on-policy com múltiplos professores no aprendizado contínuo para agentes GUI. O UI-MOPD seleciona dinamicamente um professor específico da plataforma de acordo com o ambiente atual e transfere prioridades comportamentais específicas da plataforma para uma política compartilhada por meio de destilação condicionada por plataforma, permitindo adaptação a novas plataformas enquanto preserva capacidades nas já existentes. Experimentos no OSWorld e no MobileWorld mostram que o UI-MOPD atinge taxas de sucesso de tarefas de 38,2% e 12,0%, respectivamente, demonstrando sua eficácia em equilibrar a retenção de capacidades multiplataforma e a adaptação a novas plataformas. Página do projeto: https://elispectre.github.io/UI-MOPD/.
English
Recent advances in multimodal foundation models and agent systems have driven GUI agents from single-platform task execution toward cross-platform interaction. However, building multi-platform GUI agents remains challenging. On one hand, high-quality and executable cross-platform interaction trajectories are still scarce, and existing data often suffer from limited platform coverage. On the other hand, different platforms exhibit distinct interaction conventions, making joint or continual training prone to behavioral pattern mixing, platform-specific capability degradation, and catastrophic forgetting. To address these challenges, we construct Uni-GUI, a high-quality cross-platform GUI interaction dataset, and propose UI-MOPD, the first method that incorporates multi-teacher on-policy distillation into continual learning for GUI agents. UI-MOPD dynamically selects a platform-specific teacher according to the current environment and transfers platform-specific behavioral priors to a shared policy through platform-conditioned distillation, enabling adaptation to new platforms while preserving capabilities on existing ones. Experiments on OSWorld and MobileWorld show that UI-MOPD achieves task success rates of 38.2% and 12.0%, respectively, demonstrating its effectiveness in balancing cross-platform capability retention and new-platform adaptation. Project page: https://elispectre.github.io/UI-MOPD/.