ChatPaper.aiChatPaper

UI-MOPD: Многоплатформенная дистилляция на политике для непрерывного обучения GUI-агента

UI-MOPD: Multi-Platform On-Policy Distillation for Continual GUI Agent Learning

July 5, 2026
Авторы: Niu Lian, Alan Chen, Zhehao Yu, Chengzhen Duan, Fazhan Liu, Hui Liu, Pei Fu, Jian Luan, Yaowei Wang, Shu-Tao Xia, Jinpeng Wang
cs.AI

Аннотация

Последние достижения в области мультимодальных фундаментальных моделей и агентных систем стимулировали переход GUI-агентов от выполнения задач на одной платформе к кроссплатформенному взаимодействию. Однако создание многоплатформенных GUI-агентов по-прежнему сопряжено с трудностями. С одной стороны, качественные и выполнимые траектории кроссплатформенного взаимодействия остаются дефицитными, а существующие данные часто характеризуются ограниченным охватом платформ. С другой стороны, различные платформы демонстрируют отличные соглашения о взаимодействии, что делает совместное или последовательное обучение склонным к смешению поведенческих шаблонов, ухудшению специфичных для платформы способностей и катастрофическому забыванию. Для решения этих проблем мы создали Uni-GUI — высококачественный набор данных кроссплатформенного GUI-взаимодействия, и предложили UI-MOPD — первый метод, интегрирующий многопреподавательскую дистилляцию на политике в непрерывное обучение для GUI-агентов. UI-MOPD динамически выбирает специфичного для платформы преподавателя в соответствии с текущей средой и переносит специфичные для платформы поведенческие априорные знания в общую политику посредством дистилляции с учетом платформы, обеспечивая адаптацию к новым платформам при сохранении способностей на существующих. Эксперименты на OSWorld и MobileWorld показывают, что UI-MOPD достигает показателей успешности выполнения задач 38,2% и 12,0% соответственно, демонстрируя свою эффективность в балансировании сохранения кроссплатформенных способностей и адаптации к новым платформам. Страница проекта: https://elispectre.github.io/UI-MOPD/.
English
Recent advances in multimodal foundation models and agent systems have driven GUI agents from single-platform task execution toward cross-platform interaction. However, building multi-platform GUI agents remains challenging. On one hand, high-quality and executable cross-platform interaction trajectories are still scarce, and existing data often suffer from limited platform coverage. On the other hand, different platforms exhibit distinct interaction conventions, making joint or continual training prone to behavioral pattern mixing, platform-specific capability degradation, and catastrophic forgetting. To address these challenges, we construct Uni-GUI, a high-quality cross-platform GUI interaction dataset, and propose UI-MOPD, the first method that incorporates multi-teacher on-policy distillation into continual learning for GUI agents. UI-MOPD dynamically selects a platform-specific teacher according to the current environment and transfers platform-specific behavioral priors to a shared policy through platform-conditioned distillation, enabling adaptation to new platforms while preserving capabilities on existing ones. Experiments on OSWorld and MobileWorld show that UI-MOPD achieves task success rates of 38.2% and 12.0%, respectively, demonstrating its effectiveness in balancing cross-platform capability retention and new-platform adaptation. Project page: https://elispectre.github.io/UI-MOPD/.