GaP : Un cadre d'auto-apprentissage multi-agent basé sur le graphe comme politique pour des tâches d'automatisation variationnelle
GaP: A Graph-as-Policy Multi-Agent Self-Learning Harness For Variational Automation Tasks
July 6, 2026
Auteurs: Kaiyuan Chen, Shuangyu Xie, Letian Fu, Justin Yu, William Pacini, Sandeep Bajamahal, Hudson Kim, Jaimyn Drake, Daehwa Kim, Haoru Xue, Jonathan Francis, Christian Juette, Peter Schaldenbrand, Muhammet Yunus Seker, Ruwan Wickramarachchi, Uksang Yoo, Guanzhi Wang, Adithyavairavan Murali, Balakumar Sundaralingam, S. Shankar Sastry, Spencer Huang, Yuke Zhu, Linxi "Jim" Fan, Ken Goldberg
cs.AI
Résumé
Pour que les robots fonctionnent de manière fiable dans les applications commerciales et industrielles, les récentes avancées en matière de systèmes de codage agentique peuvent-elles combiner une programmation robotique interprétable avec l'adaptabilité en environnement ouvert des politiques sans modèle ? Nous nous concentrons sur l'« Automation Variationnelle » (AV), une classe de tâches présentant des variations plus importantes de la géométrie et de la pose des objets que l'automation fixe. Les politiques sans modèle peinent souvent à combler le fossé de fiabilité pour les tâches AV, qui doivent être exécutées de manière persistante et fiable dans les applications commerciales et industrielles. Motivés par les travaux antérieurs sur la Planification de Tâches et de Mouvements (TAMP) et le Système d'Exploitation Robotique (ROS), nous introduisons Graph-as-Policy (GaP), un harnais de codage multi-agent qui génère des graphes de calcul orientés avec des nœuds de perception, de planification et de contrôle à partir d'une Bibliothèque Modulaire Ouverte de Compétences Robotiques (MORSL). GaP génère ensuite un environnement de simulation interne pour répéter des instances de tâches avec différents graphes en parallèle, afin d'affiner itérativement la structure et les paramètres des graphes pour améliorer les taux de succès et le débit. L'évaluation sur 8 nouveaux benchmarks ouverts de tâches AV, dont 4 en simulation et 4 dans le monde réel, suggère que GaP peut atteindre des taux de succès significativement supérieurs aux références. Les détails, le code et les données sont disponibles en ligne : https://graph-robots.github.io/gap
English
For robots to work reliably in commercial and industrial applications, can recent advances in agentic coding systems combine interpretable robot programming with the open-world adaptability of model-free policies? We focus on "Variational Automation" (VA), a class of tasks that have larger variations in object geometry and pose than fixed automation. Model-free policies often struggle to close the reliability gap for VA tasks, which must be executed persistently and reliably in commercial and industrial applications. Motivated by prior work on Task and Motion Planning (TAMP) and the Robot Operating System (ROS), we introduce Graph-as-Policy (GaP), a multi-agent coding harness that generates directed computation graphs with perception, planning, and control nodes from a Modular Open Robot Skill Library (MORSL). GaP then generates an internal simulation environment to rehearse task instances with different graphs in parallel to iteratively refine the graph structure and parameters to improve success rates and throughput. Evaluation with 8 new open VA task benchmarks, 4 in-simulation and 4 in real-world, suggests that GaP can achieve success rates that significantly outperform baselines. Details, code, and data can be found online: https://graph-robots.github.io/gap