ChatPaper.aiChatPaper

UI-MOPD: Destilación On-Policy Multiplataforma para el Aprendizaje Continuo de Agentes GUI

UI-MOPD: Multi-Platform On-Policy Distillation for Continual GUI Agent Learning

July 5, 2026
Autores: Niu Lian, Alan Chen, Zhehao Yu, Chengzhen Duan, Fazhan Liu, Hui Liu, Pei Fu, Jian Luan, Yaowei Wang, Shu-Tao Xia, Jinpeng Wang
cs.AI

Resumen

Los avances recientes en modelos fundacionales multimodales y sistemas de agentes han impulsado a los agentes de GUI desde la ejecución de tareas en una única plataforma hacia la interacción multiplataforma. Sin embargo, construir agentes de GUI multiplataforma sigue siendo un desafío. Por un lado, las trayectorias de interacción multiplataforma de alta calidad y ejecutables siguen siendo escasas, y los datos existentes suelen tener una cobertura limitada de plataformas. Por otro lado, las diferentes plataformas presentan convenciones de interacción distintas, lo que hace que el entrenamiento conjunto o continuo sea propenso a la mezcla de patrones de comportamiento, la degradación de capacidades específicas de cada plataforma y el olvido catastrófico. Para abordar estos desafíos, construimos Uni-GUI, un conjunto de datos de interacción GUI multiplataforma de alta calidad, y proponemos UI-MOPD, el primer método que incorpora destilación en política con múltiples maestros en el aprendizaje continuo para agentes de GUI. UI-MOPD selecciona dinámicamente un maestro específico de la plataforma según el entorno actual y transfiere prioridades de comportamiento específicas de la plataforma a una política compartida mediante destilación condicionada por plataforma, lo que permite la adaptación a nuevas plataformas mientras se preservan las capacidades en las existentes. Los experimentos en OSWorld y MobileWorld muestran que UI-MOPD alcanza tasas de éxito de tareas del 38.2% y 12.0%, respectivamente, demostrando su eficacia para equilibrar la retención de capacidades multiplataforma y la adaptación a nuevas plataformas. Página del proyecto: https://elispectre.github.io/UI-MOPD/.
English
Recent advances in multimodal foundation models and agent systems have driven GUI agents from single-platform task execution toward cross-platform interaction. However, building multi-platform GUI agents remains challenging. On one hand, high-quality and executable cross-platform interaction trajectories are still scarce, and existing data often suffer from limited platform coverage. On the other hand, different platforms exhibit distinct interaction conventions, making joint or continual training prone to behavioral pattern mixing, platform-specific capability degradation, and catastrophic forgetting. To address these challenges, we construct Uni-GUI, a high-quality cross-platform GUI interaction dataset, and propose UI-MOPD, the first method that incorporates multi-teacher on-policy distillation into continual learning for GUI agents. UI-MOPD dynamically selects a platform-specific teacher according to the current environment and transfers platform-specific behavioral priors to a shared policy through platform-conditioned distillation, enabling adaptation to new platforms while preserving capabilities on existing ones. Experiments on OSWorld and MobileWorld show that UI-MOPD achieves task success rates of 38.2% and 12.0%, respectively, demonstrating its effectiveness in balancing cross-platform capability retention and new-platform adaptation. Project page: https://elispectre.github.io/UI-MOPD/.