ProMSA: Progressieve Multimodale Zoekagenten voor Kennisgebaseerd Visueel Vraagbeantwoorden
ProMSA:Progressive Multimodal Search Agents for Knowledge-Based Visual Question Answering
June 26, 2026
Auteurs: ZhengXian Wu, Hangrui Xu, Kai Shi, Zhuohong Chen, Yunyao Yu, Chuanrui Zhang, Zirui Liao, Jun Yang, Zhenyu Yang, Haonan Lu, Haoqian Wang
cs.AI
Samenvatting
Knowledge-based Visual Question Answering (KB-VQA) vereist dat modellen beeldbegrip combineren met externe kennis. De meeste bestaande methoden gebruiken een vaste ophaal-en-genereerpijplijn met een vooraf geselecteerde ophaalmethode en een statische top-k-instelling, die niet adaptief is tijdens het redeneren. Wij stellen ProMSA voor, een progressieve multimodale zoekagent voor KB-VQA. Bij een beeld-vraagpaar kiest de agent iteratief voor beeldzoekopdracht, tekstzoekopdracht of stoppen, onder expliciete budgetten voor toolaanroepen en met deduplicatie om overbodig ophalen te voorkomen. Voor training gebruiken we eerst verwerpingssteekproef-SFT om geldige toolgebruikformaten aan te leren, en optimaliseren we vervolgens de agent met TN-GSPO, een RL-doelstelling op sequentieniveau die updates normaliseert op basis van zowel generatielengte als diepte van toolinteractie. Experimenten op E-VQA en InfoSeek tonen consistente winst aan ten opzichte van sterke RAG- en agentbaselines, evenals verbeterde ophaal- en end-to-endnauwkeurigheid. De code is beschikbaar op https://github.com/DingWu1021/Promsa.
English
Knowledge-based Visual Question Answering (KB-VQA) requires models to combine image understanding with external knowledge. Most prior methods use a fixed retrieve-then-generate pipeline with a pre-selected retriever and a static top-k setting, which is not adaptive during reasoning. We propose ProMSA, a progressive multimodal search agent for KB-VQA. Given an image-question pair, the agent iteratively chooses image search, text search, or stop, under explicit tool-call budgets and with deduplication to avoid redundant retrieval. For training, we first use rejection-sampling SFT to learn valid tool-use formats, then optimize the agent with TN-GSPO, a sequence-level RL objective that normalizes updates by both generation length and tool-interaction depth. Experiments on E-VQA and InfoSeek show consistent gains over strong RAG and agent baselines, and improved retrieval and end-to-end accuracy. The code is available at https://github.com/DingWu1021/Promsa.