PalmClaw: Un marco de trabajo de agente nativo en el dispositivo para teléfonos móviles
PalmClaw: A Native On-Device Agent Framework for Mobile Phones
July 14, 2026
Autores: Hongru Cai, Yongqi Li, Ran Wei, Wenjie Li
cs.AI
Resumen
Los agentes basados en Modelos de Lenguaje Grande (LLM) han trascendido la simple generación de respuestas para ejecutar tareas de múltiples pasos mediante la invocación de herramientas, la observación de resultados y la decisión iterativa de la siguiente acción. La mayoría de los sistemas de agentes operan en computadoras de escritorio o servidores, lo que permite el uso de herramientas y la automatización de tareas. Los dispositivos móviles también constituyen entornos importantes para agentes, dado su amplia accesibilidad y su capacidad para almacenar datos, sensores y aplicaciones de uso cotidiano del usuario. Los agentes móviles existentes interactúan principalmente con teléfonos inteligentes mediante acciones en la interfaz gráfica de usuario (GUI), como tocar, deslizar y escribir, lo que genera secuencias largas y dependientes de la interfaz, impide el acceso directo a las capacidades del dispositivo y dificulta la definición de límites de ejecución. Presentamos PalmClaw, un marco de trabajo para agentes de código abierto que se ejecuta de forma nativa en teléfonos móviles y gestiona directamente en el dispositivo las sesiones, la memoria, las habilidades, las herramientas y el ciclo del agente. PalmClaw expone las capacidades del dispositivo como herramientas del dispositivo con argumentos explícitos, resultados estructurados y límites de ejecución claramente definidos. Este diseño permite que los agentes utilicen directamente las capacidades móviles, manteniendo cada acción explícita y controlada. Los experimentos muestran una mejora relativa del 11.5% en el éxito de las tareas y una reducción del 94.9% en el tiempo de finalización en comparación con la línea base más sólida, con una menor carga de configuración y trazas que ilustran cómo se aplican los límites de ejecución. El código está disponible en https://github.com/ModalityDance/PalmClaw.
English
Large Language Model (LLM) agents have moved beyond generating responses to executing multi-step tasks by calling tools, observing the results, and iteratively deciding the next action. Most agent systems run on desktops or servers, which support tool use and task automation. Mobile devices are also important agent environments because they are widely accessible and contain users' data, sensors, and daily-use applications. Existing mobile agents mainly operate smartphones through graphical user interface (GUI) actions such as tapping, swiping, and typing, which often form long, interface-dependent sequences, cannot directly access device capabilities, and make execution boundaries difficult to define. We present PalmClaw, an open-source agent framework that runs natively on mobile phones and manages the sessions, memory, skills, tools, and agent loop directly on the device. PalmClaw exposes device capabilities as device tools with explicit arguments, structured results, and clearly defined execution boundaries. This design enables agents to use mobile capabilities directly while keeping each action explicit and controlled. Experiments show an 11.5\% relative improvement in task success and a 94.9\% reduction in completion time over the strongest baseline, with lower setup burden and traces illustrating how execution boundaries are applied. Code is available at https://github.com/ModalityDance/PalmClaw.