arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-02-20 至 2026-02-20 共收录 3 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 3 篇

2602.06530 2026-02-20 cs.CV cs.CR 79%

Universal Anti-forensics Attack against Image Forgery Detection via Multi-modal Guidance

面向图像伪造检测的通用反取证攻击框架 via 多模态指导

Haipeng Li, Rongxuan Peng, Anwei Luo, Shunquan Tan, Changsheng Chen, Anastasia Antsiferova

机构 * Shenzhen University, China(深圳大学) Nanyang Technological University, Singapore(南洋理工大学) Shenzhen MSU-BIT University, China(深圳MSU-BIT大学) Lomonosov Moscow State University's Institute for Artificial Intelligence, Russia(罗蒙诺索夫莫斯科国立大学人工智能研究所)

专题命中 图文多模态 :multi-modal(title,abstract);分类 cs.CV

AI总结 本文提出ForgeryEraser框架,通过多模态指导损失实现对图像伪造检测器的通用反取证攻击,揭示了VLMs依赖性带来的对抗性漏洞,并展示了对先进AIGC检测器的性能影响。

Comments 17 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15943 2026-02-20 cs.CV 70%

Boosting Medical Visual Understanding From Multi-Granular Language Learning

通过多粒度语言学习提升医学视觉理解

Zihan Li, Yiqing Wang, Sina Farsiu, Paul Kinahan

机构 * University of Washington(华盛顿大学) Duke University(杜克大学)

专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV

AI总结 本文提出MGLL框架,通过多粒度语言学习提升医学影像的视觉理解能力,改进多标签和跨粒度对齐,提升下游任务性能。

Comments Accepted by ICLR 2026. 40 pages

Journal ref The Fourteenth International Conference on Learning Representations (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17645 2026-02-20 cs.LG cs.AI cs.CL cs.CV 67%

Pushing the Frontier of Black-Box LVLM Attacks via Fine-Grained Detail Targeting

通过细粒度细节靶向推动大视觉-语言模型攻击的前沿

Xiaohan Zhao, Zhaoyi Li, Yaxin Luo, Jiacheng Cui, Zhiqiang Shen

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 通过细粒度细节靶向改进M-Attack,显著提升黑盒攻击效果,成功率达100%

Comments Code at: https://github.com/vila-lab/M-Attack-V2

详情

展开后加载摘要…

URL PDF HTML 收藏