ChatPaper.aiChatPaper

Segmentation Consciente de la Récupération Web (W-RAC) pour des Systèmes de Génération Augmentée par Récupération Efficaces et Économiques

Web Retrieval-Aware Chunking (W-RAC) for Efficient and Cost-Effective Retrieval-Augmented Generation Systems

January 8, 2026
Auteurs: Uday Allu, Sonu Kedia, Tanmay Odapally, Biddwan Ahmed
cs.AI

Résumé

Les systèmes de génération augmentée par récupération (RAG) dépendent de manière cruciale de stratégies efficaces de segmentation documentaire pour équilibrer qualité de récupération, latence et coût opérationnel. Les approches traditionnelles de segmentation, telles que la segmentation à taille fixe, basée sur des règles ou entièrement agentique, souffrent souvent d'une consommation élevée de tokens, de génération de texte redondante, d'une scalabilité limitée et d'une faible capacité de débogage, particulièrement pour l'ingestion de contenu web à grande échelle. Dans cet article, nous proposons Web Retrieval-Aware Chunking (W-RAC), un nouveau cadre de segmentation économe conçu spécifiquement pour les documents web. W-RAC dissocie l'extraction de texte de la planification sémantique des segments en représentant le contenu web analysé comme des unités structurées adressables par identifiant, et en n'utilisant les grands modèles de langage (LLM) que pour des décisions de regroupement conscientes de la récupération plutôt que pour la génération de texte. Cela réduit significativement l'utilisation de tokens, élimine les risques d'hallucination et améliore l'observabilité du système. Les analyses expérimentales et la comparaison architecturale démontrent que W-RAC atteint des performances de récupération comparables ou supérieures aux approches traditionnelles tout en réduisant d'un ordre de grandeur les coûts LLM liés à la segmentation.
English
Retrieval-Augmented Generation (RAG) systems critically depend on effective document chunking strategies to balance retrieval quality, latency, and operational cost. Traditional chunking approaches, such as fixed-size, rule-based, or fully agentic chunking, often suffer from high token consumption, redundant text generation, limited scalability, and poor debuggability, especially for large-scale web content ingestion. In this paper, we propose Web Retrieval-Aware Chunking (W-RAC), a novel, cost-efficient chunking framework designed specifically for web-based documents. W-RAC decouples text extraction from semantic chunk planning by representing parsed web content as structured, ID-addressable units and leveraging large language models (LLMs) only for retrieval-aware grouping decisions rather than text generation. This significantly reduces token usage, eliminates hallucination risks, and improves system observability.Experimental analysis and architectural comparison demonstrate that W-RAC achieves comparable or better retrieval performance than traditional chunking approaches while reducing chunking-related LLM costs by an order of magnitude.