arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-01-23 至 2026-01-23 共收录 3 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 3 篇

2601.16108 2026-01-23 cs.AI 74%

Multimodal Climate Disinformation Detection: Integrating Vision-Language Models with External Knowledge Sources

多模态气候虚假信息检测:整合视觉-语言模型与外部知识源

Marzieh Adeli Shamsabad, Hamed Ghodrati

机构 * CRIM

专题命中 图文多模态 :multimodal(title);分类 cs.AI

AI总结 本文提出整合视觉-语言模型与外部知识源,以提升多模态气候虚假信息检测的准确性与实时性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01747 2026-01-23 cs.CR cs.AI cs.CV cs.LG 62%

Crafting Adversarial Inputs for Large Vision-Language Models Using Black-Box Optimization

为大型视觉-语言模型设计对抗输入使用黑盒优化

Jiwei Guan, Haibo Jin, Haohan Wang

机构 * School of Computing, Macquarie University(麦考瑞大学计算机学院) School of Information Sciences, University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校信息科学学院)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出了一种基于零阶优化的黑盒劫持攻击方法,针对大型视觉-语言模型实现高成功率的对抗性攻击,揭示了当前模型安全机制的不足。

Comments EACL

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15949 2026-01-23 cs.AI astro-ph.IM 57%

Natural Language-Driven Global Mapping of Martian Landforms

基于自然语言的火星地表全球映射

Yiran Wang, Shuoyuan Wang, Zhaoran Wei, Jiannan Zhao, Zhonghua Yao, Zejian Xie, Songxin Zhang, Jun Huang, Bingyi Jing, Hongxin Wei

机构 * School of Science, Southern University of Science and Technology(南方科技大学科学学院) China University of Geosciences(中国地质大学) University of Hong Kong(香港大学) Hubei Key Laboratory of Planetary Geology, China University of Geosciences(湖北省行星地质重点实验室,中国地质大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 图文多模态 :image-text(abstract);分类 cs.AI

AI总结 MarScope通过自然语言驱动的视觉-语言框架,实现了火星地表的全球映射,实现了高效、灵活的地质分析和大规模数据探索。

详情

展开后加载摘要…

URL PDF HTML 收藏