ChatPaper.aiChatPaper

VaseMuseum : Musée numérique intelligent pour la poterie grecque antique

VaseMuseum: Digital Intelligent Museum for Ancient Greek Pottery

July 7, 2026
Auteurs: Jiazi Wang, Nonghai Zhang, Qiushi Xie, Zeyu Zhang, Yufeng Chen, Yang Zhao, Ling Shao, Hao Tang
cs.AI

Résumé

Les modèles vision-langage (VLMs) rendent les musées numériques interactifs de plus en plus réalisables en reliant la numérisation 3D à l'exploration d'artefacts en langage naturel. Cependant, dans les domaines du patrimoine culturel tels que la poterie grecque antique, l'assistance fiable des VLMs est limitée par deux défis. Premièrement, l'interprétation ouverte nécessite d'ancrer des preuves visuelles 2D/3D fines dans des connaissances curatoriales spécialisées, mais le processus de récupération peut introduire des sources faibles et des références invérifiables. Deuxièmement, lorsque les preuves disponibles sont incomplètes, bruitées ou ambiguës, les VLMs produisent souvent des réponses confiantes mais non étayées au lieu d'une incertitude calibrée. Pour relever ces défis, nous proposons VaseMuseum, un cadre d'agent multimodal léger et modulaire pour les musées numériques intelligents de poterie grecque antique. VaseMuseum combine un musée virtuel interactif avec VaseAgent, qui prend en charge à la fois les images 2D et les artefacts 3D grâce à la perception multimodale, au raisonnement conscient de la 3D, à la récupération de connaissances externes et au contrôle de fiabilité au moment de l'inférence. Plus précisément, VaseAgent récupère des preuves à partir de sources web autorisées et de connaissances muséales, et un contrôle au niveau de la source sélectionne des preuves diverses et vérifiables avant la génération. Parallèlement, un contrôle au niveau de la réponse vérifie les affirmations générées par rapport au vivier de preuves et encourage des réponses neutres et limitées par les preuves lorsque le soutien est insuffisant ou contradictoire. De plus, un mécanisme de sélection de style GRPO sans entraînement favorise les réponses avec des références valides et une confiance calibrée sans mettre à jour le backbone du VLM. Des expériences dans une simulation réaliste de musée numérique montrent que VaseMuseum améliore la validité des citations, réduit les hallucinations sur les requêtes intensives en connaissances et produit des réponses plus neutres en cas d'ambiguïté par rapport aux baselines VLM avec recherche.
English
Vision-language models (VLMs) have made interactive digital museums increasingly feasible by connecting 3D digitization with natural-language artifact exploration. However, in cultural heritage domains such as ancient Greek pottery, reliable VLM assistance is limited by two challenges. First, open-ended interpretation requires grounding fine-grained 2D/3D visual evidence in specialized curatorial knowledge, yet the retrieval process may introduce weak sources and unverifiable references. Second, when the available evidence is incomplete, noisy, or ambiguous, VLMs often produce confident but unsupported answers instead of calibrated uncertainty. To address these challenges, we propose VaseMuseum, a lightweight and modular multimodal agent framework for intelligent digital museums of ancient Greek pottery. VaseMuseum combines an interactive virtual museum with VaseAgent, which supports both 2D images and 3D artifacts through multimodal perception, 3D-aware reasoning, external knowledge retrieval, and inference-time reliability control. Specifically, VaseAgent retrieves evidence from authoritative web and museum knowledge sources, and source-level control selects diverse and verifiable evidence before generation. Meanwhile, response-level control checks generated claims against the evidence pool and encourages neutral, evidence-bounded answers when support is insufficient or conflicting. Moreover, a training-free GRPO-style selection mechanism favors responses with valid references and calibrated confidence without updating the VLM backbone. Experiments in a realistic digital museum simulation show that VaseMuseum improves citation validity, reduces hallucinations on knowledge-intensive queries, and produces more neutral answers under ambiguity compared with search-enabled VLM baselines.