AGE: Adaptieve maskering voor graafinbedding in graaf-ophaal-verbeterde generatie
AGE: Adaptive-masking for Graph Embedding in Graph Retrieval-Augmented Generation
June 30, 2026
Auteurs: Bao Long Nguyen Huu, Atsushi Hashimoto
cs.AI
Samenvatting
GraphRAG is een uitbreiding van retrieval-versterkte generatie (RAG) die grote taalmodellen (LLM's) ondersteunt door te verwijzen naar grafiekgestructureerde data als externe kennis. Hoewel deze techniek idealiter complexe relaties vastlegt, worstelt deze vaak met grafiekrepresentaties voor LLM's, met name voor bevroren LLM's, vanwege de mismatch tussen op grafieken gebaseerde en op tekst gebaseerde latente kenmerken. We pakken dit probleem aan door de {\it Adaptieve-masking voor Grafiekembedding (AGE)} te introduceren. AGE maakt gebruik van een Transformer in een op maskering gebaseerde zelfgecontroleerde leerbenadering (SSL). We hebben de architectuur ontworpen die lijkt op tekstembedding-encoders, waarmee de misalignering van latente kenmerken wordt aangepakt. In tegenstelling tot natuurlijke taalteksten zijn grafieken bondige representaties, en bestaan er {\it sleutelknooppunten} die dominante contextuele informatie bevatten, die moeilijk te voorspellen zijn op basis van hun omgeving. Het maskeren van dergelijke sleutelknooppunten leidt tot inefficiëntie in het SSL-proces. Daarom richt AGE zich op het voorspellen van knooppunten anders dan sleutelknooppunten, met behulp van een leerbare knooppuntsteekproefnemer. Onze experimentele resultaten geven aan dat AGE aanzienlijk de prestaties verbetert van methoden die een niet-parametrische zoekcomponent gebruiken in GraphQA-taken, met superieure nauwkeurigheid op vier benchmarkdatasets met verschillende kenmerken.
English
GraphRAG is an extension of retrieval-augmented generation (RAG) that supports large language models (LLMs) by referring to graph-structured data as external knowledge. While this technique ideally captures intricate relationships, it often struggles with graph representations for LLMs, particularly for frozen LLMs, due to the misalignment between graph-based and text-based latent features. We tackle this issue by introducing the {\it Adaptive-masking for Graph Embedding (AGE)}. AGE employs a Transformer in a mask-based self-supervised learning (SSL) approach. We designed the architecture similar to text embedding encoders, addressing the latent feature misalignment. In contrast to natural language texts, graphs are concise representations, and there exist {\it key nodes} that hold dominant contextual information, which are challenging to predict from their surroundings. Masking such key nodes leads to inefficiency in the SSL process. Therefore, AGE focuses on predicting nodes apart from key nodes, utilizing a learnable node sampler. Our experimental results indicate that AGE significantly improves approaches using non-parametric search component in GraphQA tasks, achieving superior accuracy across four benchmark datasets with distinct characteristics.