ChatPaper.aiChatPaper

ToolCUA: Naar optimale GUI-tool padorkestratie voor computergebruiksagenten

ToolCUA: Towards Optimal GUI-Tool Path Orchestration for Computer Use Agents

May 12, 2026
Auteurs: Xuhao Hu, Xi Zhang, Haiyang Xu, Kyle Qiao, Jingyi Yang, Xuanjing Huang, Jing Shao, Ming Yan, Jieping Ye
cs.AI

Samenvatting

Computer Use Agents (CUA's) kunnen handelen via zowel atomaire GUI-acties, zoals klikken en typen, als hoogwaardige toolaanroepen, zoals API-gebaseerde bestandsbewerkingen, maar deze hybride actieruimte laat hen vaak in onzekerheid over wanneer ze door moeten gaan met GUI-acties of moeten overschakelen naar tools, wat leidt tot suboptimale uitvoeringspaden. Deze moeilijkheid komt voort uit de schaarste aan hoogwaardige interleaved GUI-Tool-trajecten, de kosten en breekbaarheid van het verzamelen van echte tooltrajecten, en het gebrek aan trajectniveau-supervisie voor GUI-Tool-padselectie. In dit artikel stellen we ToolCUA voor, een end-to-end agent die is ontworpen om optimale GUI-Tool-padselectie te leren via een getrapt trainingsparadigma. We introduceren eerst een Interleaved GUI-Tool Trajectory Scaling Pipeline die overvloedige statische GUI-trajecten hergebruikt en een verankerde toolbibliotheek synthetiseert, waardoor diverse GUI-Tool-trajecten mogelijk worden zonder handmatige engineering of verzameling van echte tooltrajecten. Vervolgens voeren we Tool-Bootstrapped GUI RFT uit, waarbij we warmup SFT combineren met single-turn RL om de beslissingen op kritieke GUI-Tool-schakelpunten te verbeteren. Ten slotte optimaliseren we ToolCUA met Online Agentic RL in een hoogwaardige GUI-Tool-omgeving, geleid door een Tool-Efficient Path Reward die passend toolgebruik en kortere uitvoeringspaden aanmoedigt. Experimenten op OSWorld-MCP tonen aan dat ToolCUA een nauwkeurigheid van 46,85% behaalt, een relatieve verbetering van ongeveer 66% ten opzichte van de basislijn, waarmee een nieuw state-of-the-art wordt gevestigd onder modellen van vergelijkbare schaal. Het verbetert ook met 3,9% ten opzichte van alleen-GUI-instellingen, wat effectieve GUI-Tool-orkestratie aantoont. De resultaten suggereren verder dat training in een hybride actieruimte een veelbelovend paradigma is voor digitale agenten in de echte wereld. Open source beschikbaar op: https://x-plug.github.io/ToolCUA/
English
Computer Use Agents (CUAs) can act through both atomic GUI actions, such as click and type, and high-level tool calls, such as API-based file operations, but this hybrid action space often leaves them uncertain about when to continue with GUI actions or switch to tools, leading to suboptimal execution paths. This difficulty stems from the scarcity of high-quality interleaved GUI-Tool trajectories, the cost and brittleness of collecting real tool trajectories, and the lack of trajectory-level supervision for GUI-Tool path selection. In this paper, we propose ToolCUA, an end-to-end agent designed to learn optimal GUI-Tool path selection through a staged training paradigm. We first introduce an Interleaved GUI-Tool Trajectory Scaling Pipeline that repurposes abundant static GUI trajectories and synthesizes a grounded tool library, enabling diverse GUI-Tool trajectories without manual engineering or real tool-trajectory collection. We then perform Tool-Bootstrapped GUI RFT, combining warmup SFT with single-turn RL to improve decisions at critical GUI-Tool switching points. Finally, we optimize ToolCUA with Online Agentic RL in a high-fidelity GUI-Tool environment, guided by a Tool-Efficient Path Reward that encourages appropriate tool use and shorter execution paths. Experiments on OSWorld-MCP show that ToolCUA achieves 46.85% accuracy, a relative improvement of approximately 66% over the baseline, establishing a new state of the art among models of comparable scale. It also improves by 3.9% over GUI-only settings, demonstrating effective GUI-Tool orchestration. The results further suggest that training in a hybrid action space is a promising paradigm for real-world digital agents. Open-sourced here: https://x-plug.github.io/ToolCUA/