arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-12-17 至 2025-12-17 共收录 3 信号源:cs.CV, cs.AI, cs.LG

1. 幻觉与鲁棒性 3 篇

2512.14320 2025-12-17 cs.CV cs.AI cs.CY cs.LG 67%

Semantic Mismatch and Perceptual Degradation: A New Perspective on Image Editing Immunity

语义不匹配与感知退化:图像编辑免疫的新视角

Shuai Dong, Jie Zhang, Guoying Zhao, Shiguang Shan, Xilin Chen

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences (CAS)(人工智能安全国家重点实验室,计算技术研究所,中国科学院) University of China Academy of Sciences(中国科学院大学) Center for Machine Vision and Signal Analysis, University of Oulu(信号分析中心,奥卢大学) School of Computer Science, China University of Geosciences(计算机科学学院,中国地质大学)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出SIFM方法和ISR度量标准,通过语义不匹配和感知退化来评估图像编辑免疫效果,提升对抗恶意扩散式操纵的能力。

Comments 11 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14102 2025-12-17 cs.CV cs.AI cs.IR 62%

Neurosymbolic Inference On Foundation Models For Remote Sensing Text-to-image Retrieval With Complex Queries

面向遥感文本到图像检索的神经符号推理:为复杂查询的基座模型

Emanuele Mezzi, Gertjan Burghouts, Maarten Kruithof

机构 * Vrije Universiteit Amsterdam(瓦赫宁根大学阿姆斯特丹) TNO(荷兰国防研究院)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 RUNE通过结合大型语言模型和神经符号AI,利用逻辑推理提升遥感文本到图像检索的性能与可解释性,针对复杂查询和图像不确定性提出新的评估指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.04960 2025-12-17 cs.CV cs.AI 62%

MIMIR: Masked Image Modeling for Mutual Information-based Adversarial Robustness

MIMIR:基于互信息的对抗鲁棒性图像建模

Xiaoyun Xu, Shujian Yu, Zhuoran Liu, Stjepan Picek

机构 * Radboud University Nijmegen(拉德博德大学尼姆维根分校) Vrije Universiteit Amsterdam(自由大学阿姆斯特丹) University of Zagreb Faculty of Electrical Engineering and Computing(Zagreb大学电子工程与计算学院)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 MIMIR通过互信息惩罚和自编码器的遮蔽图像建模,提升视觉变换器的对抗鲁棒性。

Comments Accepted by NDSS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏