ChatPaper.aiChatPaper

MMG2Skill : Les agents peuvent-ils distiller des guides en milieu naturel en compétences auto-évolutives ?

MMG2Skill: Can Agents Distill In-the-Wild Guides into Self-Evolving Skills?

June 1, 2026
Auteurs: Xinyu Che, Junqi Xiong, Yunfei Ge, Xinping Lei, Shihao Li, Hang Yan, Han Li, Yuanxing Zhang, Zhiqi Bai, Jinhua Hao, Ming Sun, Han Li, Jiaheng Liu
cs.AI

Résumé

Les connaissances procédurales abondantes sur le Web offrent un potentiel considérable pour aider les agents à résoudre des tâches à long horizon. Cependant, ces connaissances sont souvent multimodales, hétérogènes, bruitées et supposent implicitement des exécutants humains, ce qui les rend difficiles à utiliser directement comme les compétences requises par les agents. Pour combler l’écart entre les guides orientés humains et les compétences exécutables par les agents, nous formalisons ce problème sous le nom d’apprentissage guide-à-compétence : convertir des guides du monde réel en compétences exécutables et les améliorer continuellement à partir des trajectoires observables par l’agent. Pour évaluer la capacité des agents existants sur cette tâche, nous introduisons MMG2Skill-Bench, le premier banc d’essai conçu pour ce problème. Nous proposons également MMG2Skill, un cadre en boucle fermée qui compile les guides en compétences modifiables, conditionne un agent à modèle vision-langage (VLM) fixe sur ces compétences lors de l’exécution, et révise les compétences à partir d’un retour d’information de cause racine au niveau des trajectoires, sans utiliser les scores du banc d’essai. Dans le contrôle d’interface graphique, le jeu vidéo ouvert et le jeu de cartes stratégique avec six architectures VLM, MMG2Skill surpasse systématiquement les agents de référence de base dans chaque paramètre modèle-domaine, avec des gains moyens macro de +12,8 à +25,3 points de pourcentage selon les architectures. Les études d’ablation montrent que solliciter directement les agents avec des guides bruts peut dégrader les performances, tandis que la construction structurée de compétences et la révision guidée par les trajectoires sont toutes deux nécessaires aux améliorations observées. Dans les tâches dont le succès est inférable, l’arrêt précoce basé sur un analyseur évite en outre les régressions de performance en phase tardive et économise 25 % à 53 % des tentatives lorsque le signal de succès est correctement calibré.
English
Abundant procedural knowledge on the Web holds great potential for helping agents solve long-horizon tasks. However, such knowledge is often multimodal, heterogeneous, noisy, and implicitly assumes human executors, making it difficult to use directly as the skills required by agents. To bridge the gap between human-oriented guides and agent-executable skills, we formalize this problem as guide-to-skill learning: converting in-the-wild guides into executable skills and continuously improving them from trajectories observable to the agent. To evaluate the capability of existing agents on this task, we introduce MMG2Skill-Bench, the first benchmark designed for this problem. We further propose MMG2Skill, a closed-loop framework that compiles guides into editable skills, conditions a fixed vision-language model (VLM) agent on these skills during execution, and revises the skills from trajectory-level root-cause feedback without using benchmark scores. Across GUI control, open-ended gameplay, and strategic card play with six VLM backbones, MMG2Skill consistently outperforms vanilla baseline agents in every model-domain setting, achieving macro-average gains of +12.8 to +25.3 percentage points across backbones. Ablation studies show that directly prompting agents with raw guides can degrade performance, while both structured skill construction and trajectory-driven revision are necessary for the observed improvements. On success-inferable tasks, analyzer-based early stopping further prevents late-stage performance regressions and saves 25%-53% of attempts when the success signal is properly calibrated.