ChatPaper.aiChatPaper

Rapport technique X-OmniClaw : Un agent mobile unifié pour la compréhension et l'interaction multimodales

X-OmniClaw Technical Report: A Unified Mobile Agent for Multimodal Understanding and Interaction

May 7, 2026
Auteurs: Xiaoming Ren, Ru Zhen, Chao Li, Yang Song, Qiuxia Hou, Yanhao Zhang, Peng Liu, Qi Qi, Quanlong Zheng, Qi Wu, Zhenyi Liao, Binqiang Pan, Haobo Ji, Haonan Lu
cs.AI

Résumé

Inspiré par le développement d'OpenClaw, il existe une demande croissante d'agents personnels mobiles capables de gérer des interactions complexes et intuitives. Dans ce rapport technique, nous présentons X-OmniClaw, un agent mobile unifié conçu pour la compréhension et l'interaction multimodales dans l'écosystème Android. Cette architecture unifiée de perception, de mémoire et d'action permet à l'agent de traiter des tâches mobiles complexes avec une forte conscience contextuelle. Plus précisément, Omni Perception offre un pipeline d'entrée multimodal unifié qui intègre les états de l'interface utilisateur, les contextes visuels du monde réel et les entrées vocales, en exploitant un module d'alignement temporel pour décomposer les données brutes en représentations d'intention multimodales structurées. Omni Memory utilise l'optimisation de la mémoire multimodale pour renforcer l'intelligence personnalisée en intégrant une mémoire de travail d'exécution pour la continuité des tâches avec une mémoire personnelle à long terme distillée à partir de données locales, permettant ainsi des interactions hautement contextuelles et personnalisées. Enfin, Omni Action emploie une stratégie d'ancrage hybride qui combine des métadonnées XML structurelles avec une perception visuelle pour une interaction robuste. Grâce au clonage de comportement et au rejeu de trajectoire, le système capture la navigation de l'utilisateur comme des compétences réutilisables, permettant une exécution précise en accès direct. Les démonstrations dans divers scénarios montrent que X-OmniClaw améliore efficacement l'efficacité des interactions et la fiabilité des tâches, fournissant un modèle architectural pratique pour la prochaine génération d'assistants personnels natifs mobiles.
English
Inspired by the development of OpenClaw, there is a growing demand for mobile-based personal agents capable of handling complex and intuitive interactions. In this technical report, we introduce X-OmniClaw, a unified mobile agent designed for multimodal understanding and interaction in the Android ecosystem. This unified architecture of perception, memory, and action enables the agent to handle complex mobile tasks with high contextual awareness. Specifically, Omni Perception provides a unified multimodal ingress pipeline that integrates UI states, real-world visual contexts, and speech inputs, leveraging a temporal alignment module to decompose raw data into structured multimodal intent representations. Omni Memory leverages multimodal memory optimization to enhance personalized intelligence by integrating runtime working memory for task continuity with long-term personal memory distilled from local data, enabling highly context-aware and personalized interactions. Finally, Omni Action employs a hybrid grounding strategy that combines structural XML metadata with visual perception for robust interaction. Through Behavior Cloning and Trajectory Replay, the system captures user navigation as reusable skills, enabling precise direct-access execution. Demonstrations across diverse scenarios show that X-OmniClaw effectively enhances interaction efficiency and task reliability, providing a practical architectural blueprint for the next generation of mobile-native personal assistants.