RaV-IDP : Un cadre de Reconstruction-comme-Validation pour un Traitement Intelligent des Documents Fidèle
RaV-IDP: A Reconstruction-as-Validation Framework for Faithful Intelligent Document Processing
April 26, 2026
Auteurs: Pritesh Jha
cs.AI
Résumé
Les pipelines de traitement intelligent de documents extraient des entités structurées (tableaux, images et texte) des documents pour une utilisation dans des systèmes en aval tels que les bases de connaissances, la génération augmentée par la récupération et l'analytique. Une limitation persistante des pipelines existants est que la sortie de l'extraction est produite sans aucun mécanisme intrinsèque pour vérifier si elle représente fidèlement la source. Les scores de confiance internes aux modèles mesurent la certitude de l'inférence, et non la correspondance avec le document, et les erreurs d'extraction passent silencieusement aux consommateurs en aval.
Nous présentons Reconstruction as Validation (RaV-IDP), un pipeline de traitement de documents qui introduit la reconstruction comme une composante architecturale de premier ordre. Après l'extraction de chaque entité, un reconstructeur dédié restitue la représentation extraite sous une forme comparable à la région originale du document, et un comparateur évalue la fidélité entre la reconstruction et le recadrage source non modifié. Ce score de fidélité constitue un signal de qualité ancré et sans étiquette. Lorsque la fidélité tombe en dessous d'un seuil défini par type d'entité, une procédure de secours structurée utilisant GPT-4.1 Vision est déclenchée et la boucle de validation se répète. Nous imposons une contrainte d'amorçage : le comparateur s'ancre toujours sur la région originale du document, jamais sur l'extraction, empêchant ainsi la validation de devenir circulaire.
Nous proposons en outre un cadre d'évaluation par phase associant chaque composant du pipeline à un benchmark approprié. Le code du pipeline est publiquement disponible à l'adresse https://github.com/pritesh-2711/RaV-IDP pour l'expérimentation et l'utilisation.
English
Intelligent document processing pipelines extract structured entities (tables, images, and text) from documents for use in downstream systems such as knowledge bases, retrieval-augmented generation, and analytics. A persistent limitation of existing pipelines is that extraction output is produced without any intrinsic mechanism to verify whether it faithfully represents the source. Model-internal confidence scores measure inference certainty, not correspondence to the document, and extraction errors pass silently into downstream consumers.
We present Reconstruction as Validation (RaV-IDP), a document processing pipeline that introduces reconstruction as a first-class architectural component. After each entity is extracted, a dedicated reconstructor renders the extracted representation back into a form comparable to the original document region, and a comparator scores fidelity between the reconstruction and the unmodified source crop. This fidelity score is a grounded, label-free quality signal. When fidelity falls below a per-entity-type threshold, a structured GPT-4.1 vision fallback is triggered and the validation loop repeats. We enforce a bootstrap constraint: the comparator always anchors against the original document region, never against the extraction, preventing the validation from becoming circular.
We further propose a per-stage evaluation framework pairing each pipeline component with an appropriate benchmark. The code pipeline is publicly available at https://github.com/pritesh-2711/RaV-IDP for experimentation and use.