arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-02-02 至 2026-02-02 共收录 2 信号源:cs.CV, cs.AI, cs.LG

1. 幻觉与鲁棒性 2 篇

2511.00067 2026-02-02 cs.LG cs.AI 84%

Latent Domain Prompt Learning for Vision-Language Models

潜在领域提示学习用于视觉-语言模型

Zhixing Li, Arsham Gholamzadeh Khoee, Yinan Yu

机构 * Chalmers University of Technology Department of Computer Science(查尔姆斯理工大学计算机科学与工程系)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);VLM(abstract);分类 cs.AI、cs.LG

AI总结 本文提出通过潜在领域聚类和文本特征融合,提升视觉-语言模型在无领域标签情况下的泛化能力与鲁棒性。

Comments Accepted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23041 2026-02-02 cs.CV 57%

One-shot Optimized Steering Vector for Hallucination Mitigation for VLMs

单次优化的转向向量用于VLMs的幻觉缓解

Youxu Shi, Suorong Yang, Dong Liu

机构 * University of Science(科学大学) Nanjing University(南京大学)

专题命中 幻觉与鲁棒性 :vision language model(abstract);分类 cs.CV

AI总结 本文提出OSGA框架,通过单次优化生成通用转向向量,有效缓解VLMs的幻觉问题并提升安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏