VaseMuseum: Digitaal Intelligent Museum voor Oud-Grieks Aardewerk
VaseMuseum: Digital Intelligent Museum for Ancient Greek Pottery
July 7, 2026
Auteurs: Jiazi Wang, Nonghai Zhang, Qiushi Xie, Zeyu Zhang, Yufeng Chen, Yang Zhao, Ling Shao, Hao Tang
cs.AI
Samenvatting
Visie-taalmodellen (VLMs) maken interactieve digitale musea steeds haalbaarder door 3D-digitalisering te verbinden met verkenning van artefacten in natuurlijke taal. In domeinen van cultureel erfgoed, zoals Oud-Griekse aardewerk, wordt betrouwbare VLM-ondersteuning echter beperkt door twee uitdagingen. Ten eerste vereist open interpretatie het verankeren van fijnmazig 2D/3D visueel bewijs in gespecialiseerde conservatoriale kennis, maar het retrievalproces kan zwakke bronnen en onverifieerbare referenties introduceren. Ten tweede produceren VLMs, wanneer het beschikbare bewijs onvolledig, ruisachtig of dubbelzinnig is, vaak zelfverzekerde maar niet-onderbouwde antwoorden in plaats van gekalibreerde onzekerheid. Om deze uitdagingen aan te pakken, stellen we VaseMuseum voor, een lichtgewicht en modulair multimodaal agentraamwerk voor intelligente digitale musea van Oud-Griekse aardewerk. VaseMuseum combineert een interactief virtueel museum met VaseAgent, dat zowel 2D-afbeeldingen als 3D-artefacten ondersteunt via multimodale perceptie, 3D-bewust redeneren, externe kennisretrieval en betrouwbaarheidscontrole tijdens inferentie. Specifiek haalt VaseAgent bewijs uit gezaghebbende web- en museumkennisbronnen, en zorgt bronniveaucontrole voor de selectie van diverse en verifieerbare bewijzen vóór generatie. Tegelijkertijd controleert reactieniveaucontrole gegenereerde claims tegen de bewijspool en moedigt het neutrale, bewijsgebonden antwoorden aan wanneer ondersteuning onvoldoende of tegenstrijdig is. Bovendien bevordert een training-vrij GRPO-stijl selectiemechanisme antwoorden met geldige referenties en gekalibreerde zekerheid, zonder de VLM-backbone bij te werken. Experimenten in een realistische digitale museumsimulatie tonen aan dat VaseMuseum de citatiegeldigheid verbetert, hallucinaties bij kennisintensieve queries vermindert en meer neutrale antwoorden produceert bij dubbelzinnigheid in vergelijking met zoekfunctionaliteit-bevattende VLM-baselines.
English
Vision-language models (VLMs) have made interactive digital museums increasingly feasible by connecting 3D digitization with natural-language artifact exploration. However, in cultural heritage domains such as ancient Greek pottery, reliable VLM assistance is limited by two challenges. First, open-ended interpretation requires grounding fine-grained 2D/3D visual evidence in specialized curatorial knowledge, yet the retrieval process may introduce weak sources and unverifiable references. Second, when the available evidence is incomplete, noisy, or ambiguous, VLMs often produce confident but unsupported answers instead of calibrated uncertainty. To address these challenges, we propose VaseMuseum, a lightweight and modular multimodal agent framework for intelligent digital museums of ancient Greek pottery. VaseMuseum combines an interactive virtual museum with VaseAgent, which supports both 2D images and 3D artifacts through multimodal perception, 3D-aware reasoning, external knowledge retrieval, and inference-time reliability control. Specifically, VaseAgent retrieves evidence from authoritative web and museum knowledge sources, and source-level control selects diverse and verifiable evidence before generation. Meanwhile, response-level control checks generated claims against the evidence pool and encourages neutral, evidence-bounded answers when support is insufficient or conflicting. Moreover, a training-free GRPO-style selection mechanism favors responses with valid references and calibrated confidence without updating the VLM backbone. Experiments in a realistic digital museum simulation show that VaseMuseum improves citation validity, reduces hallucinations on knowledge-intensive queries, and produces more neutral answers under ambiguity compared with search-enabled VLM baselines.