arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-02-05 至 2026-02-05 共收录 4 信号源:cs.CV, cs.AI, cs.LG

1. 幻觉与鲁棒性 4 篇

2503.20504 2026-02-05 cs.CV 83%

UniVRSE: Unified Vision-conditioned Response Semantic Entropy for Hallucination Detection in Medical Vision-Language Models

UniVRSE: 统一的视觉条件响应语义熵用于医学视觉语言模型中的幻觉检测

Zehui Liao, Shishuai Hu, Ke Zou, Mengyuan Jin, Yanning Zhang, Huazhu Fu, Liangli Zhen, Yong Xia

机构 * National Engineering Laboratory for Integrated Aero-Space-Ground-Ocean Big Data Application Technology, School of Computer Science and Engineering, Northwestern Polytechnical University(集成航空航天地面海洋大数据应用技术国家工程实验室,计算机科学与工程学院,西北工业大学)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);visual question answering(abstract);分类 cs.CV

AI总结 UniVRSE通过统一的视觉条件响应语义熵框架,有效检测医学视觉语言模型中的幻觉,提升临床应用的可靠性。

Comments Under Review. 12 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03910 2026-02-05 eess.IV 67%

CONRep: Uncertainty-Aware Vision-Language Report Drafting Using Conformal Prediction

CONRep:基于置信预测的不确定性感知视觉-语言报告起草

Danial Elyassirad, Benyamin Gheiji, Mahsa Vatanparast, Amir Mahmoud Ahmadzadeh, Seyed Amir Asef Agah, Mana Moassefi, Meysam Tavakoli, Shahriar Faghani

专题命中 幻觉与鲁棒性 :vision-language model(abstract);VLM(abstract)

AI总结 CONRep通过置信预测为视觉语言模型生成的放射学报告提供不确定性量化,提升自动化报告系统的透明性和临床实用性。

Comments 17 pages, 3 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04340 2026-02-05 cs.CV cs.AI 62%

Explicit Uncertainty Modeling for Active CLIP Adaptation with Dual Prompt Tuning

显式不确定性建模用于主动CLIP适应与双提示微调

Qian-Wei Wang, Yaguang Song, Shu-Tao Xia

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) Institute of Perceptual Intelligence, Peng Cheng Laboratory(感知智能研究院,鹏城实验室)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出基于双提示微调的显式不确定性建模框架,用于提升主动CLIP适应的分类可靠性与主动样本选择效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03895 2026-02-05 cs.CV cs.LG 62%

Benchmarking Bias Mitigation Toward Fairness Without Harm from Vision to LVLMs

面向视觉到大视觉语言模型的公平性无害基准测试

Xuwei Tan, Ziyu Hu, Xueru Zhang

机构 * The Ohio State University(俄亥俄州立大学) Stevens Institute of Technology(史蒂文斯理工学院)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 NH-Fair提出一个统一基准,评估视觉到大视觉语言模型的公平性无害性,通过系统调优和数据增强方法减少偏见,提升公平性和准确性。

Comments Accepted at ICLR 26

详情

展开后加载摘要…

URL PDF HTML 收藏