arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-12-19 至 2025-12-19 共收录 5 信号源:cs.CV, cs.AI, cs.LG

1. 幻觉与鲁棒性 5 篇

2505.17509 2025-12-19 cs.CV 79%

MoAPT: Mixture of Adversarial Prompt Tuning for Vision-Language Models

MoAPT: 基于对抗提示微调的视觉-语言模型混合

Shiji Zhao, Qihui Zhu, Shukun Xiong, Shouwei Ruan, Maoxun Yuan, Jialing Tao, Jiexi Liu, Ranjie Duan, Jie Zhang, Jie Zhang, Xingxing Wei

机构 * Institute of Artificial Intelligence, Beihang University, Beijing, China(北京航空航天大学人工智能研究院) Center for Frontier AI Research, A*STAR, Singapore(A*STAR前沿人工智能研究中心) Institute of Computing Technology, Chinese Academy of Sciences, China(中国科学院计算技术研究所)

专题命中 幻觉与鲁棒性 :vision-language model(title);vision language model(abstract);分类 cs.CV

AI总结 MoAPT通过混合对抗提示微调提升视觉-语言模型对多种对抗攻击的鲁棒性,通过学习多个提示的混合权重以增强泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16921 2025-12-19 cs.CV cs.AI 62%

Differences That Matter: Auditing Models for Capability Gap Discovery and Rectification

关键差异:用于能力缺口发现与纠正的模型审计

Qihao Liu, Chengzhi Mao, Yaojie Liu, Alan Yuille, Wen-Sheng Chu

机构 * Google(谷歌) Johns Hopkins University(约翰霍普金斯大学)

专题命中 幻觉与鲁棒性 :MLLM(abstract);分类 cs.CV、cs.AI

AI总结 AuditDM通过主动发现和纠正多模态大语言模型的失败模式,提升模型性能和诊断能力。

Comments project page: https://auditdm.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16723 2025-12-19 cs.LG 57%

KOSS: Kalman-Optimal Selective State Spaces for Long-Term Sequence Modeling

KOSS:基于卡尔曼最优选择状态空间的长期序列建模

Lei Wang, Xin Tan, Mingwei Wang, Ying Zhang

机构 * School of Electronic Information(电子信息学院) Artificial Intelligence, Shaanxi University of Science(人工智能,陕西科技大学)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.LG

AI总结 KOSS通过卡尔曼最优选择机制,在长期序列建模中实现高效且鲁棒的上下文感知选择,显著提升预测准确性和稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15776 2025-12-19 cs.AI cs.MA cs.RO 57%

Emergence: Overcoming Privileged Information Bias in Asymmetric Embodied Agents via Active Querying

涌现:通过主动查询克服不对称具身智能体中的特权信息偏差

Shaun Baek, Sam Liu, Joseph Ukpong

机构 * Emory University(埃默里大学)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI

AI总结 本文通过主动查询机制解决不对称具身智能体中的特权信息偏差问题,揭示了沟通接地错误对协作成功率的影响。

Comments 12 pages, 9 pages of content, 6 tables, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01185 2025-12-19 cs.CR 50%

DefenSee: Dissecting Threat from Sight and Text -- A Multi-View Defensive Pipeline for Multi-modal Jailbreaks

DefenSee:从视觉和文本中解构威胁——一种多视图防御管道用于多模态对抗突破

Zihao Wang, Kar Wai Fok, Vrizlynn L. L. Thing

专题命中 幻觉与鲁棒性 :MLLM(abstract)

AI总结 DefenSee通过图像变体转录和跨模态一致性检查,提供一种多模态防御方法,有效降低多模态对抗攻击的成功率,提升模型鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏