DeepRefine: Agent-Gecompileerde Kennisverfijning via Reinforcement Learning
DeepRefine: Agent-Compiled Knowledge Refinement via Reinforcement Learning
May 11, 2026
Auteurs: Haoyu Huang, Jiaxin Bai, Shujie Liu, Yang Wei, Hong Ting Tsang, Yisen Gao, Zhongwei Xie, Yufei Li, Yangqiu Song
cs.AI
Samenvatting
Agent-gecompileerde kennisbanken bieden persistente externe kennis voor grote taalmodel (LLM) agenten in open, kennisintensieve stroomafwaartse taken. Toch wordt hun kwaliteit systematisch beperkt door onvolledigheid, onjuistheid en redundantie, wat zich uit in ontbrekend bewijs of cross-document koppelingen, claims met een lage betrouwbaarheid of onnauwkeurigheid, en problemen met ambiguïteit of coreferentieresolutie. Dergelijke gebreken verergeren bij iteratief gebruik, wat de retrieval-betrouwbaarheid en de prestaties op stroomafwaartse taken aantast. We presenteren DeepRefine, een algemeen op LLM gebaseerd redeneermodel voor agent-gecompileerde kennisverfijning, dat de kwaliteit van elke vooraf geconstrueerde kennisbank verbetert met gebruikersquery's, zodat deze geschikter wordt voor de stroomafwaartse taken. DeepRefine voert multi-turn interacties uit met de kennisbank, voert een abductieve diagnose uit over de interactiegeschiedenis, lokaliseert waarschijnlijke gebreken en voert gerichte verfijningsacties uit voor incrementele updates van de kennisbank. Om het verfijningsbeleid van DeepRefine te optimaliseren zonder goudreferenties, introduceren we een Gain-Beyond-Draft (GBD)-beloning en trainen we het redeneerproces end-to-end via versterkingsleren. Uitgebreide experimenten tonen consistente stroomafwaartse verbeteringen aan ten opzichte van sterke basislijnen.
English
Agent-compiled knowledge bases provide persistent external knowledge for large language model (LLM) agents in open-ended, knowledge-intensive downstream tasks. Yet their quality is systematically limited by incompleteness, incorrectness, and redundancy, manifested as missing evidence or cross-document links, low-confidence or imprecise claims, and ambiguous or coreference resolution issues. Such defects compound under iterative use, degrading retrieval fidelity and downstream task performance. We present DeepRefine, a general LLM-based reasoning model for agent-compiled knowledge refinement that improves the quality of any pre-constructed knowledge bases with user queries to make it more suitable for the downstream tasks. DeepRefine performs multi-turn interactions with the knowledge base and conducts abductive diagnosis over interaction history, localizes likely defects, and executes targeted refinement actions for incremental knowledge base updates. To optimize refinement policies of DeepRefine without gold references, we introduce a Gain-Beyond-Draft (GBD) reward and train the reasoning process end-to-end via reinforcement learning. Extensive experiments demonstrate consistent downstream gains over strong baselines.