ChatPaper.aiChatPaper

Relatório Técnico Xiaomi-GUI-0

Xiaomi-GUI-0 Technical Report

June 30, 2026
Autores: Wanxia Cao, Chengzhen Duan, Pei Fu, Pengzhi Gao, Niu Lian, Fazhan Liu, Hui Liu, Heng Qu, Qinzhuo Wu, Zhehao Yu, Tongbo Chen, Shiqi Cui, Anan Du, Shukai Jia, Yuanfa Li, Yike Liu, Wenchao Lu, Haoyuan Sun, Jiatong Sun, Cheng Tan, Yajie Wang, Changqiao Wu, Tao Xiong, Jiahui Yang, Yuxuan Yuan, Ruoceng Zhang, Shaojie Zhang, Jian Zhu, Jian Luan, Cong Zou
cs.AI

Resumo

Agentes de interface gráfica do usuário (GUI) baseiam-se em modelos de visão-linguagem para concluir tarefas do usuário de ponta a ponta em aplicações reais por meio de ações de interface, como toques, deslizes, entrada de texto e navegação. No entanto, os agentes GUI existentes são amplamente treinados e avaliados em trajetórias offline, ambientes simulados e benchmarks padronizados. Esses diferem substancialmente das aplicações reais em layout de interface, lógica de interação e distribuição de estados anormais, e não conseguem caracterizar fielmente a estabilidade de execução no uso real, onde estados de conta, diálogos de permissão, autenticação de pagamento e controle de risco remodelam continuamente a distribuição de estados e abrem uma lacuna persistente entre as pontuações de benchmark e a usabilidade real. Para fechar essa lacuna, propomos o Xiaomi-GUI-0, um agente GUI multimodal nativo para ambientes móveis reais, treinado e avaliado dentro de um ciclo fechado em dispositivos reais. Seu núcleo é uma infraestrutura híbrida dominada por dispositivos reais, na qual os dispositivos físicos são o ambiente de execução primário e os sandboxes fornecem suporte auxiliar, de modo que coleta de dados, treinamento, implantação e avaliação compartilham uma distribuição de execução próxima à implantação real. Construímos dados de treinamento de múltiplas fontes abrangendo tarefas principais de alta frequência, dados de alta generalização para intenções de cauda longa e dados de aprimoramento de capacidade para reflexão e memória, e introduzimos um volante de dados orientado a erros que transforma trajetórias de falha em ações corrigidas, explicações reflexivas e demonstrações de recuperação. O modelo é treinado por meio de um pipeline progressivo de três estágios: ajuste fino supervisionado, aprendizado por reforço em nível de etapa e aprendizado por reforço agentivo. Avaliado em benchmarks públicos e em nosso RealMobile interno, o Xiaomi-GUI-0 alcança 72,0% de sucesso no RealMobile e 78,9% no AndroidWorld, ao mesmo tempo que melhora substancialmente a estabilidade de execução e o reconhecimento de estados anormais em tarefas do mundo real.
English
Graphical user interface (GUI) agents build on vision-language models to complete user tasks end-to-end in real applications through interface actions such as tapping, swiping, text entry, and navigation. However, existing GUI agents are trained and evaluated largely on offline trajectories, simulated environments, and standardized benchmarks. These differ substantially from real applications in interface layout, interaction logic, and abnormal-state distribution, and cannot faithfully characterize execution stability in real-world use, where account states, permission dialogs, payment authentication, and risk control continually reshape the state distribution and open a persistent gap between benchmark scores and real usability. To close this gap, we propose Xiaomi-GUI-0, a native multimodal GUI agent for real mobile environments, trained and evaluated within a real-device closed loop. At its core is a real-device-dominant hybrid infrastructure, where physical devices are the primary execution environment and sandboxes provide auxiliary support, so that data collection, training, rollout, and evaluation share an execution distribution close to real deployment. We construct multi-source training data spanning high-frequency head tasks, high-generalization data for long-tail intents, and capability-enhancement data for reflection and memory, and introduce an error-driven data flywheel that turns failure trajectories into corrected actions, reflective explanations, and recovery demonstrations. The model is trained through a progressive three-stage pipeline of supervised fine-tuning, step-level reinforcement learning, and agentic reinforcement learning. Evaluated on public benchmarks and our in-house RealMobile, Xiaomi-GUI-0 achieves 72.0% success on RealMobile and 78.9% on AndroidWorld, while substantially improving execution stability and abnormal-state recognition in real-world tasks.