Multimodal Climate Disinformation Detection: Integrating Vision-Language Models with External Knowledge Sources
多模态气候虚假信息检测:整合视觉-语言模型与外部知识源
机构 * CRIM
专题命中 图文多模态 :multimodal(title);分类 cs.AI
AI总结 本文提出整合视觉-语言模型与外部知识源,以提升多模态气候虚假信息检测的准确性与实时性。
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
多模态气候虚假信息检测:整合视觉-语言模型与外部知识源
机构 * CRIM
专题命中 图文多模态 :multimodal(title);分类 cs.AI
AI总结 本文提出整合视觉-语言模型与外部知识源,以提升多模态气候虚假信息检测的准确性与实时性。
为大型视觉-语言模型设计对抗输入使用黑盒优化
机构 * School of Computing, Macquarie University(麦考瑞大学计算机学院) ; School of Information Sciences, University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校信息科学学院)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 本文提出了一种基于零阶优化的黑盒劫持攻击方法,针对大型视觉-语言模型实现高成功率的对抗性攻击,揭示了当前模型安全机制的不足。
Comments EACL
基于自然语言的火星地表全球映射
机构 * School of Science, Southern University of Science and Technology(南方科技大学科学学院) ; China University of Geosciences(中国地质大学) ; University of Hong Kong(香港大学) ; Hubei Key Laboratory of Planetary Geology, China University of Geosciences(湖北省行星地质重点实验室,中国地质大学) ; The Chinese University of Hong Kong(香港中文大学)
专题命中 图文多模态 :image-text(abstract);分类 cs.AI
AI总结 MarScope通过自然语言驱动的视觉-语言框架,实现了火星地表的全球映射,实现了高效、灵活的地质分析和大规模数据探索。