ChatPaper.aiChatPaper

ProMSA: Agentes Progressivos de Busca Multimodal para Resposta a Perguntas Visuais Baseada em Conhecimento

ProMSA:Progressive Multimodal Search Agents for Knowledge-Based Visual Question Answering

June 26, 2026
Autores: ZhengXian Wu, Hangrui Xu, Kai Shi, Zhuohong Chen, Yunyao Yu, Chuanrui Zhang, Zirui Liao, Jun Yang, Zhenyu Yang, Haonan Lu, Haoqian Wang
cs.AI

Resumo

A resposta visual a perguntas baseada em conhecimento (KB-VQA) exige que modelos combinem compreensão de imagem com conhecimento externo. A maioria dos métodos anteriores utiliza um pipeline fixo de recuperação-geração com um recuperador pré-selecionado e uma configuração estática de top-k, que não é adaptável durante o raciocínio. Propomos ProMSA, um agente de busca multimodal progressivo para KB-VQA. Dado um par imagem-pergunta, o agente escolhe iterativamente busca por imagem, busca por texto ou parada, sob orçamentos explícitos de chamadas de ferramentas e com deduplicação para evitar recuperação redundante. Para treinamento, primeiro usamos SFT com amostragem por rejeição para aprender formatos válidos de uso de ferramentas, depois otimizamos o agente com TN-GSPO, um objetivo de RL em nível de sequência que normaliza as atualizações tanto pelo comprimento da geração quanto pela profundidade da interação com ferramentas. Experimentos em E-VQA e InfoSeek mostram ganhos consistentes em relação a fortes baselines de RAG e agentes, e melhoria na precisão da recuperação e ponta a ponta. O código está disponível em https://github.com/DingWu1021/Promsa.
English
Knowledge-based Visual Question Answering (KB-VQA) requires models to combine image understanding with external knowledge. Most prior methods use a fixed retrieve-then-generate pipeline with a pre-selected retriever and a static top-k setting, which is not adaptive during reasoning. We propose ProMSA, a progressive multimodal search agent for KB-VQA. Given an image-question pair, the agent iteratively chooses image search, text search, or stop, under explicit tool-call budgets and with deduplication to avoid redundant retrieval. For training, we first use rejection-sampling SFT to learn valid tool-use formats, then optimize the agent with TN-GSPO, a sequence-level RL objective that normalizes updates by both generation length and tool-interaction depth. Experiments on E-VQA and InfoSeek show consistent gains over strong RAG and agent baselines, and improved retrieval and end-to-end accuracy. The code is available at https://github.com/DingWu1021/Promsa.