arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~
arXiv 2606.24112cs.AI

ReMMD: 面向多模态虚假信息检测的现实多语言多图像智能体验证

ReMMD: Realistic Multilingual Multi-Image Agentic Verification for Multimodal Misinformation Detection

  • Shanghai Jiaotong University(上海交通大学)
  • Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
  • Tsinghua University(清华大学)
  • Central South University(中南大学)
  • China Electronics Technology Group Corporation 15th Research Institute(中国电子科技集团公司第十五研究所)

机构由 AI 辅助整理,请以论文原文为准。

Chenhao Dang, Dantong Zhu, Jun Yang, Conghui He, Weijia Li

AI总结:

提出ReMMD框架,包含多语言多图像基准ReMMDBench和持久记忆验证器ReMMD-Agent,通过原子点分解和可重用证据集实现高效准确的多模态虚假信息检测。

AI中文摘要:

多模态虚假信息检测日益重要,因为病毒式传播的帖子现在结合了长篇多语言叙述、多张图像、混合来源以及细微的文本-图像框架错误。现有的基准和方法与这一场景匹配不佳:它们通常隔离短标题、单张图像、二元标签或单一操纵源,而在现实证据搜索下,智能体验证仍然成本高昂。我们提出ReMMD,一个面向多模态虚假信息检测的现实多语言多图像智能体验证框架。ReMMD包括ReMMDBench,一个包含500个样本、2,756张图像、五种单语言、两种跨语言设置、三种文本长度层级、多图像帖子、五路真实性标签、八种失真标签、证据来源和理由的真实世界多模态虚假信息检测基准。它还包括ReMMD-Agent,一个持久记忆验证器,将帖子分解为原子点,构建可重用证据集,并预测结构化的L1/L2/L3输出。在专有系统、开放LVLM、MMD-Agent和T2-Agent中,ReMMD-Agent获得了最佳的五路真实性性能,使用GPT-5.2时准确率为41.80%,宏F1为39.12%,同时相对于MMD-Agent成本降低17.5%,相对于T2-Agent成本降低79.9%。项目可在该https URL获取。

英文摘要:

Multimodal misinformation detection is increasingly important because viral posts now combine long multilingual narratives, several images, mixed provenance, and subtle cross-modal framing errors. Existing benchmarks and methods remain poorly matched to this setting: they usually isolate short captions, single images, binary labels, or one manipulation source, while agentic verification remains costly under realistic evidence search. We present ReMMD, a realistic multilingual multi-image agentic verification framework for multimodal misinformation detection. ReMMD includes ReMMDBench, a real-world multimodal misinformation detection benchmark with 500 samples, 2,756 images, five monolingual evaluations, two cross-lingual settings, three text-length tiers, multi-image posts, five-way veracity labels, eight distortion labels, evidence provenance, and rationales. It also includes ReMMD-Agent, a persistent-memory verifier that decomposes posts into atomic points, builds a reusable evidence set, and predicts structured veracity verdicts, fine-grained distortion diagnoses, and explanatory rationales. Across proprietary systems, open LVLMs, MMD-Agent, and T$^2$-Agent, ReMMD-Agent obtains the best five-way veracity performance, with 41.80% accuracy and 39.12% macro-F1 using GPT-5.2, while reducing cost by 17.5% relative to MMD-Agent and 79.9% relative to T$^2$-Agent. The project is available at https://dang-ai.github.io/ReMMD.

补充信息

↑