DeepRefine: Refinamento de Conhecimento Compilado por Agentes via Aprendizado por Reforço
DeepRefine: Agent-Compiled Knowledge Refinement via Reinforcement Learning
May 11, 2026
Autores: Haoyu Huang, Jiaxin Bai, Shujie Liu, Yang Wei, Hong Ting Tsang, Yisen Gao, Zhongwei Xie, Yufei Li, Yangqiu Song
cs.AI
Resumo
Bases de conhecimento compiladas por agentes fornecem conhecimento externo persistente para agentes de modelos de linguagem de grande escala (LLMs) em tarefas downstream abertas e intensivas em conhecimento. No entanto, sua qualidade é sistematicamente limitada por incompletude, incorreção e redundância, manifestadas como evidências ausentes ou lacunas em links entre documentos, afirmações de baixa confiança ou imprecisas, e problemas ambíguos ou de resolução de correferência. Tais defeitos se agravam sob uso iterativo, degradando a fidelidade da recuperação e o desempenho em tarefas downstream. Apresentamos o DeepRefine, um modelo de raciocínio geral baseado em LLM para refinamento de conhecimento compilado por agentes, que melhora a qualidade de quaisquer bases de conhecimento pré-construídas com consultas de usuários, tornando-as mais adequadas para as tarefas downstream. O DeepRefine realiza interações de múltiplas rodadas com a base de conhecimento, conduz diagnóstico abdutivo sobre o histórico de interações, localiza prováveis defeitos e executa ações de refinamento direcionadas para atualizações incrementais da base de conhecimento. Para otimizar as políticas de refinamento do DeepRefine sem referências douradas, introduzimos uma recompensa Gain-Beyond-Draft (GBD) e treinamos o processo de raciocínio de ponta a ponta via aprendizado por reforço. Experimentos extensivos demonstram ganhos consistentes em tarefas downstream em relação a linhas de base fortes.
English
Agent-compiled knowledge bases provide persistent external knowledge for large language model (LLM) agents in open-ended, knowledge-intensive downstream tasks. Yet their quality is systematically limited by incompleteness, incorrectness, and redundancy, manifested as missing evidence or cross-document links, low-confidence or imprecise claims, and ambiguous or coreference resolution issues. Such defects compound under iterative use, degrading retrieval fidelity and downstream task performance. We present DeepRefine, a general LLM-based reasoning model for agent-compiled knowledge refinement that improves the quality of any pre-constructed knowledge bases with user queries to make it more suitable for the downstream tasks. DeepRefine performs multi-turn interactions with the knowledge base and conducts abductive diagnosis over interaction history, localizes likely defects, and executes targeted refinement actions for incremental knowledge base updates. To optimize refinement policies of DeepRefine without gold references, we introduce a Gain-Beyond-Draft (GBD) reward and train the reasoning process end-to-end via reinforcement learning. Extensive experiments demonstrate consistent downstream gains over strong baselines.