ChatPaper.aiChatPaper

ReMMD: Verificação Realista, Multilíngue e Multi-Imagem Baseada em Agentes para Detecção de Desinformação Multimodal

ReMMD: Realistic Multilingual Multi-Image Agentic Verification for Multimodal Misinformation Detection

June 23, 2026
Autores: Chenhao Dang, Dantong Zhu, Jun Yang, Conghui He, Weijia Li
cs.AI

Resumo

A detecção multimodal de desinformação é cada vez mais importante porque publicações virais agora combinam narrativas longas multilíngues, várias imagens, proveniência mista e erros sutis de enquadramento texto-imagem. Os benchmarks e métodos existentes permanecem mal adaptados a esse cenário: eles geralmente isolam legendas curtas, imagens únicas, rótulos binários ou uma única fonte de manipulação, enquanto a verificação agêntica permanece custosa em uma busca realista de evidências. Apresentamos o ReMMD, uma estrutura realista de verificação agêntica multilíngue e multi-imagem para detecção multimodal de desinformação. O ReMMD inclui o ReMMDBench, um benchmark realista de detecção multimodal de desinformação com 500 amostras, 2.756 imagens, cinco idiomas monolíngues, duas configurações cross-linguais, três níveis de comprimento de texto, publicações com múltiplas imagens, rótulos de veracidade de cinco classes, oito rótulos de distorção, proveniência de evidências e fundamentações. Também inclui o ReMMD-Agent, um verificador de memória persistente que decompõe publicações em pontos atômicos, constrói um conjunto de evidências reutilizável e prevê saídas estruturadas L1/L2/L3. Entre sistemas proprietários, LVLMs abertos, MMD-Agent e T2-Agent, o ReMMD-Agent obtém o melhor desempenho de veracidade em cinco classes, com 41,80% de acurácia e 39,12% de macro-F1 usando GPT-5.2, enquanto reduz o custo em 17,5% em relação ao MMD-Agent e 79,9% em relação ao T2-Agent. O projeto está disponível em https://dang-ai.github.io/ReMMD.
English
Multimodal misinformation detection is increasingly important because viral posts now combine long multilingual narratives, several images, mixed provenance, and subtle text--image framing errors. Existing benchmarks and methods remain poorly matched to this setting: they usually isolate short captions, single images, binary labels, or one manipulation source, while agentic verification remains costly under realistic evidence search. We present ReMMD, a realistic multilingual multi-image agentic verification framework for multimodal misinformation detection. ReMMD includes ReMMDBench, a real-world multimodal misinformation detection benchmark with 500 samples, 2,756 images, five monolingual languages, two cross-lingual settings, three text-length tiers, multi-image posts, five-way veracity labels, eight distortion labels, evidence provenance, and rationales. It also includes ReMMD-Agent, a persistent-memory verifier that decomposes posts into atomic points, builds a reusable evidence set, and predicts structured L1/L2/L3 outputs. Across proprietary systems, open LVLMs, MMD-Agent, and T2-Agent, ReMMD-Agent obtains the best five-way veracity performance, with 41.80% accuracy and 39.12% macro-F1 using GPT-5.2, while reducing cost by 17.5% relative to MMD-Agent and 79.9% relative to T2-Agent. The project is available at https://dang-ai.github.io/ReMMD.