ChatPaper.aiChatPaper

Árvore Abstrata Hierárquica para Geração Aumentada por Recuperação em Múltiplos Documentos

Hierarchical Abstract Tree for Cross-Document Retrieval-Augmented Generation

May 1, 2026
Autores: Ziwen Zhao, Menglin Yang
cs.AI

Resumo

A geração aumentada por recuperação (RAG) aprimora os grandes modelos de linguagem com conhecimento externo, e a RAG baseada em árvores organiza documentos em índices hierárquicos para suportar consultas em múltiplas granularidades. No entanto, os métodos existentes de Tree-RAG, concebidos para recuperação de documento único, enfrentam desafios críticos ao escalar para perguntas multi-hop entre documentos: (1) baixa adaptabilidade distribucional, onde o agrupamento k-means introduz ruído devido a suposições distribucionais rígidas; (2) isolamento estrutural, uma vez que os índices em árvore carecem de conexões explícitas entre documentos; e (3) abstração grosseira, que obscurece detalhes de granularidade fina. Para superar estas limitações, propomos o Ψ-RAG, um framework tree-RAG com dois componentes-chave. Primeiro, um índice de árvore abstrata hierárquica construído através de um processo iterativo de "fusão e colapso" que se adapta às distribuições de dados sem uma suposição a priori. Segundo, um agente de recuperação multi-granular que interage inteligentemente com a base de conhecimento por meio de consultas reorganizadas e um recuperador híbrido acionado por agente. O Ψ-RAG suporta diversas tarefas, desde questionamento ao nível de *token* até sumarização ao nível de documento. Em *benchmarks* de QA multi-hop entre documentos, ele supera o RAPTOR em 25.9% e o HippoRAG 2 em 7.4% no score F1 médio. O código está disponível em https://github.com/Newiz430/Psi-RAG.
English
Retrieval-augmented generation (RAG) enhances large language models with external knowledge, and tree-based RAG organizes documents into hierarchical indexes to support queries at multiple granularities. However, existing Tree-RAG methods designed for single-document retrieval face critical challenges in scaling to cross-document multi-hop questions: (1) poor distribution adaptability, where k-means clustering introduces noise due to rigid distribution assumptions; (2) structural isolation, as tree indexes lack explicit cross-document connections; and (3) coarse abstraction, which obscures fine-grained details. To address these limitations, we propose Ψ-RAG, a tree-RAG framework with two key components. First, a hierarchical abstract tree index built through an iterative "merging and collapse" process that adapts to data distributions without a priori assumption. Second, a multi-granular retrieval agent that intelligently interacts with the knowledge base with reorganized queries and an agent-powered hybrid retriever. Ψ-RAG supports diverse tasks from token-level question answering to document-level summarization. On cross-document multi-hop QA benchmarks, it outperforms RAPTOR by 25.9% and HippoRAG 2 by 7.4% in average F1 score. Code is available at https://github.com/Newiz430/Psi-RAG.