DeepRefine : Raffinement de connaissances compilé par agent via l'apprentissage par renforcement
DeepRefine: Agent-Compiled Knowledge Refinement via Reinforcement Learning
May 11, 2026
Auteurs: Haoyu Huang, Jiaxin Bai, Shujie Liu, Yang Wei, Hong Ting Tsang, Yisen Gao, Zhongwei Xie, Yufei Li, Yangqiu Song
cs.AI
Résumé
Les bases de connaissances compilées par des agents fournissent une connaissance externe persistante aux agents basés sur de grands modèles de langage (LLM) dans des tâches aval ouvertes et intensives en connaissances. Cependant, leur qualité est systématiquement limitée par l'incomplétude, l'inexactitude et la redondance, se manifestant par des preuves manquantes ou des liens inter-documents, des affirmations de faible confiance ou imprécises, ainsi que des problèmes d'ambiguïté ou de résolution de coréférences. Ces défauts se cumulent lors d'une utilisation itérative, dégradant la fidélité de la récupération et les performances des tâches aval. Nous présentons DeepRefine, un modèle de raisonnement général basé sur LLM pour l'affinement des connaissances compilées par des agents, qui améliore la qualité de toute base de connaissances pré-construite à l'aide de requêtes utilisateur afin de la rendre plus adaptée aux tâches aval. DeepRefine effectue des interactions à plusieurs tours avec la base de connaissances, réalise un diagnostic abductif sur l'historique des interactions, localise les défauts probables et exécute des actions d'affinement ciblées pour des mises à jour incrémentales de la base de connaissances. Afin d'optimiser les politiques d'affinement de DeepRefine sans références de vérité terrain, nous introduisons une récompense Gain-Beyond-Draft (GBD) et entraînons le processus de raisonnement de bout en bout via l'apprentissage par renforcement. Des expériences exhaustives démontrent des gains aval constants par rapport à des bases de référence solides.
English
Agent-compiled knowledge bases provide persistent external knowledge for large language model (LLM) agents in open-ended, knowledge-intensive downstream tasks. Yet their quality is systematically limited by incompleteness, incorrectness, and redundancy, manifested as missing evidence or cross-document links, low-confidence or imprecise claims, and ambiguous or coreference resolution issues. Such defects compound under iterative use, degrading retrieval fidelity and downstream task performance. We present DeepRefine, a general LLM-based reasoning model for agent-compiled knowledge refinement that improves the quality of any pre-constructed knowledge bases with user queries to make it more suitable for the downstream tasks. DeepRefine performs multi-turn interactions with the knowledge base and conducts abductive diagnosis over interaction history, localizes likely defects, and executes targeted refinement actions for incremental knowledge base updates. To optimize refinement policies of DeepRefine without gold references, we introduce a Gain-Beyond-Draft (GBD) reward and train the reasoning process end-to-end via reinforcement learning. Extensive experiments demonstrate consistent downstream gains over strong baselines.