VaseMuseum: Museu Digital Inteligente de Cerâmica Grega Antiga
VaseMuseum: Digital Intelligent Museum for Ancient Greek Pottery
July 7, 2026
Autores: Jiazi Wang, Nonghai Zhang, Qiushi Xie, Zeyu Zhang, Yufeng Chen, Yang Zhao, Ling Shao, Hao Tang
cs.AI
Resumo
Modelos de linguagem visual (VLMs) têm tornado os museus digitais interativos cada vez mais viáveis ao conectar a digitalização 3D com a exploração de artefatos em linguagem natural. No entanto, em domínios do patrimônio cultural, como a cerâmica grega antiga, a assistência confiável dos VLMs é limitada por dois desafios. Primeiro, a interpretação em aberto requer fundamentar evidências visuais 2D/3D de granularidade fina em conhecimento curatorial especializado, mas o processo de recuperação pode introduzir fontes fracas e referências não verificáveis. Segundo, quando as evidências disponíveis são incompletas, ruidosas ou ambíguas, os VLMs frequentemente produzem respostas confiantes, mas sem suporte, em vez de incerteza calibrada. Para enfrentar esses desafios, propomos o VaseMuseum, uma estrutura agente multimodal leve e modular para museus digitais inteligentes de cerâmica grega antiga. O VaseMuseum combina um museu virtual interativo com o VaseAgent, que suporta tanto imagens 2D quanto artefatos 3D por meio de percepção multimodal, raciocínio ciente de 3D, recuperação de conhecimento externo e controle de confiabilidade em tempo de inferência. Especificamente, o VaseAgent recupera evidências de fontes autoritárias da web e de museus, e o controle em nível de fonte seleciona evidências diversas e verificáveis antes da geração. Enquanto isso, o controle em nível de resposta verifica as afirmações geradas em relação ao conjunto de evidências e incentiva respostas neutras e limitadas pelas evidências quando o suporte é insuficiente ou conflitante. Além disso, um mecanismo de seleção estilo GRPO, sem necessidade de treinamento, favorece respostas com referências válidas e confiança calibrada, sem atualizar a espinha dorsal do VLM. Experimentos em uma simulação realista de museu digital mostram que o VaseMuseum melhora a validade das citações, reduz alucinações em consultas intensivas em conhecimento e produz respostas mais neutras em situações de ambiguidade, em comparação com linhas de base de VLMs habilitadas para busca.
English
Vision-language models (VLMs) have made interactive digital museums increasingly feasible by connecting 3D digitization with natural-language artifact exploration. However, in cultural heritage domains such as ancient Greek pottery, reliable VLM assistance is limited by two challenges. First, open-ended interpretation requires grounding fine-grained 2D/3D visual evidence in specialized curatorial knowledge, yet the retrieval process may introduce weak sources and unverifiable references. Second, when the available evidence is incomplete, noisy, or ambiguous, VLMs often produce confident but unsupported answers instead of calibrated uncertainty. To address these challenges, we propose VaseMuseum, a lightweight and modular multimodal agent framework for intelligent digital museums of ancient Greek pottery. VaseMuseum combines an interactive virtual museum with VaseAgent, which supports both 2D images and 3D artifacts through multimodal perception, 3D-aware reasoning, external knowledge retrieval, and inference-time reliability control. Specifically, VaseAgent retrieves evidence from authoritative web and museum knowledge sources, and source-level control selects diverse and verifiable evidence before generation. Meanwhile, response-level control checks generated claims against the evidence pool and encourages neutral, evidence-bounded answers when support is insufficient or conflicting. Moreover, a training-free GRPO-style selection mechanism favors responses with valid references and calibrated confidence without updating the VLM backbone. Experiments in a realistic digital museum simulation show that VaseMuseum improves citation validity, reduces hallucinations on knowledge-intensive queries, and produces more neutral answers under ambiguity compared with search-enabled VLM baselines.