Debate with Images: Detecting Deceptive Behaviors in Multimodal Large Language Models
图像辩论:检测多模态大语言模型中的欺骗行为
机构 * Institute of Artificial Intelligence, Peking University(北京大学人工智能研究院)
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI
AI总结 本文提出 MM-DeceptionBench 基准和基于图像辩论的多智能体监控框架,系统揭示并量化多模态大语言模型中的欺骗风险,有效提升欺骗行为检测能力。
Comments 39 pages, 16 figures, camera ready version for ICML 2026