Récupération de l'intérieur : Une capacité intrinsèque des modèles basés sur l'attention
Retrieval from Within: An Intrinsic Capability of Attention-Based Models
May 8, 2026
Auteurs: Elad Hoffer, Yochai Blau, Edan Kinderman, Ron Banner, Daniel Soudry, Boris Ginsburg
cs.AI
Résumé
La génération augmentée par récupération (RAG) traite généralement la récupération et la génération comme des systèmes distincts. Nous nous demandons si un encodeur-décodeur basé sur l’attention peut plutôt récupérer directement à partir de ses propres représentations internes. Nous présentons INTRA (INTrinsic Retrieval via Attention), un cadre où les requêtes d’attention du décodeur notent des segments de preuve pré-encodés, qui sont ensuite directement réutilisés comme contexte pour la génération. Par construction, INTRA unifie récupération et génération, éliminant l’inadéquation entre récupérateur et générateur typique des pipelines RAG. Cette conception amortit également l’encodage du contexte en réutilisant les états d’encodeur précalculés entre les requêtes. Sur des références de question-réponse, INTRA surpasse les pipelines de récupération fortement optimisés, tant en termes de rappel des preuves que de qualité de réponse de bout en bout. Nos résultats démontrent que les modèles basés sur l’attention possèdent déjà un mécanisme de récupération qui peut être sollicité, plutôt qu’ajouté comme module externe.
English
Retrieval-augmented generation (RAG) typically treats retrieval and generation as separate systems. We ask whether an attention-based encoder-decoder can instead retrieve directly from its own internal representations. We introduce INTRA (INTrinsic Retrieval via Attention), a framework where decoder attention queries score pre-encoded evidence chunks that are then directly reused as context for generation. By construction, INTRA unifies retrieval and generation, eliminating the retriever-generator mismatch typical of RAG pipelines. This design also amortizes context encoding by reusing precomputed encoder states across queries. On question-answering benchmarks, INTRA outperforms strong engineered retrieval pipelines on both evidence recall and end-to-end answer quality. Our results demonstrate that attention-based models already possess a retrieval mechanism that can be elicited, rather than added as an external module.