ChatPaper.aiChatPaper

ReMMD : Vérification agentique réaliste multilingue multi-image pour la détection multimodale de la désinformation

ReMMD: Realistic Multilingual Multi-Image Agentic Verification for Multimodal Misinformation Detection

June 23, 2026
Auteurs: Chenhao Dang, Dantong Zhu, Jun Yang, Conghui He, Weijia Li
cs.AI

Résumé

La détection de désinformation multimodale devient de plus en plus cruciale car les publications virales combinent désormais de longs récits multilingues, plusieurs images, des provenances variées et des erreurs subtiles de cadrage texte-image. Les ensembles de données et méthodes existants restent mal adaptés à ce contexte : ils isolent généralement de courts légendes, des images uniques, des étiquettes binaires ou une seule source de manipulation, tandis que la vérification agentive reste coûteuse dans une recherche de preuves réaliste. Nous présentons ReMMD, un cadre de vérification agentive réaliste, multilingue et multi-image pour la détection de désinformation multimodale. ReMMD inclut ReMMDBench, un ensemble de données de référence réaliste pour la détection de désinformation multimodale comprenant 500 échantillons, 2 756 images, cinq langues monolingues, deux configurations cross-lingues, trois niveaux de longueur de texte, des publications multi-images, des étiquettes de vérité à cinq classes, huit étiquettes de distorsion, la provenance des preuves et des justifications. Il inclut également ReMMD-Agent, un vérificateur à mémoire persistante qui décompose les publications en points atomiques, construit un ensemble de preuves réutilisables et prédit des sorties structurées L1/L2/L3. Parmi les systèmes propriétaires, les LVLM ouverts, MMD-Agent et T2-Agent, ReMMD-Agent obtient les meilleures performances de vérité à cinq classes, avec une exactitude de 41,80 % et un score F1 macro de 39,12 % en utilisant GPT-5.2, tout en réduisant le coût de 17,5 % par rapport à MMD-Agent et de 79,9 % par rapport à T2-Agent. Le projet est disponible sur https://dang-ai.github.io/ReMMD.
English
Multimodal misinformation detection is increasingly important because viral posts now combine long multilingual narratives, several images, mixed provenance, and subtle text--image framing errors. Existing benchmarks and methods remain poorly matched to this setting: they usually isolate short captions, single images, binary labels, or one manipulation source, while agentic verification remains costly under realistic evidence search. We present ReMMD, a realistic multilingual multi-image agentic verification framework for multimodal misinformation detection. ReMMD includes ReMMDBench, a real-world multimodal misinformation detection benchmark with 500 samples, 2,756 images, five monolingual languages, two cross-lingual settings, three text-length tiers, multi-image posts, five-way veracity labels, eight distortion labels, evidence provenance, and rationales. It also includes ReMMD-Agent, a persistent-memory verifier that decomposes posts into atomic points, builds a reusable evidence set, and predicts structured L1/L2/L3 outputs. Across proprietary systems, open LVLMs, MMD-Agent, and T2-Agent, ReMMD-Agent obtains the best five-way veracity performance, with 41.80% accuracy and 39.12% macro-F1 using GPT-5.2, while reducing cost by 17.5% relative to MMD-Agent and 79.9% relative to T2-Agent. The project is available at https://dang-ai.github.io/ReMMD.