arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-12-02 至 2025-12-02 共收录 8 信号源:cs.CV, cs.AI, cs.LG

1. 幻觉与鲁棒性 8 篇

2512.01922 2025-12-02 cs.CV 83%

Med-VCD: Mitigating Hallucination for Medical Large Vision Language Models through Visual Contrastive Decoding

Med-VCD: 通过视觉对比解码缓解医疗大视觉语言模型的幻觉问题

Zahra Mahdavi, Zahra Khodakaramimaghsoud, Hooman Khaloo, Sina Bakhshandeh Taleshani, Erfan Hashemi, Javad Mirzapour Kaleybar, Omid Nejati Manzari

机构 * Department of computer science, University of Central Florida, Orlando, USA(计算机科学系,中央佛罗里达大学) Department of Bioengineering, University of Pennsylvania, Philadelphia, PA, USA(生物工程系,宾夕法尼亚大学) Department of electrical engineering, Columbia university, New York, NY, USA(电气工程系,哥伦比亚大学) Technical University of Applied Sciences Regensburg, Regensburg, Germany(应用科学技术大学(雷根斯堡)) Department of Surgery, University of Calgary, Calgary, Alberta, Canada(外科系,卡尔加里大学) University College of Nabi Akram, Tabriz, Iran(纳比阿克兰大学) School of Electrical Engineering, Iran University of Science and Technology, Tehran, Iran(电气工程学院,伊朗科学技术大学)

专题命中 幻觉与鲁棒性 :vision language model(title);vision-language model(abstract);visual question answering(abstract);分类 cs.CV

AI总结 Med-VCD通过视觉对比解码方法提升医疗大视觉语言模型的事实准确性与幻觉准确性,减少幻觉输出并提高推理效率。

Journal ref Computers in Biology and Medicine (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01300 2025-12-02 cs.AI 83%

RoboDriveVLM: A Novel Benchmark and Baseline towards Robust Vision-Language Models for Autonomous Driving

RoboDriveVLM:一种面向自动驾驶鲁棒视觉-语言模型的新型基准与基线

Dacheng Liao, Mengshi Qi, Peng Shu, Zhining Zhang, Yuxin Lin, Liang Liu, Huadong Ma

机构 * State Key Laboratory of Networking and Switching Technology(网络与交换技术国家重点实验室) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);VLM(abstract);分类 cs.AI

AI总结 RoboDriveVLM提出了一种新型基准和基线,用于评估视觉-语言模型在自动驾驶中的鲁棒性,通过模拟多种腐蚀场景提升系统可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.06284 2025-12-02 cs.AI 83%

A Comprehensive Survey and Guide to Multimodal Large Language Models in Vision-Language Tasks

多模态大语言模型在视觉-语言任务中的综合综述与指南

Chia Xin Liang, Pu Tian, Caitlyn Heqi Yin, Yao Yua, Wei An-Hou, Li Ming, Xinyuan Song, Tianyang Wang, Ziqian Bi, Ming Liu

机构 * JTB Technology Corp.(JTB技术公司) Stockton University(斯托顿大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) AppCubic USA(AppCubic美国公司) Nomad Sustaintech LTD(Nomad可持续科技有限公司) Georgia Institute of Technology(佐治亚理工学院) Emory University(埃默里大学) University of Liverpool(利物浦大学) Indiana University(印第安纳大学) Purdue University(普渡大学)

专题命中 幻觉与鲁棒性 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.AI

AI总结 本文综述了多模态大语言模型在视觉-语言任务中的应用,探讨了其架构、训练方法及挑战,并提供了理论与实践的全面指南。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20494 2025-12-02 cs.CL 82%

Adversarial Confusion Attack: Disrupting Multimodal Large Language Models

对抗混淆攻击:破坏多模态大语言模型

Jakub Hoscilowicz, Artur Janicki

机构 * Warsaw University of Technology(华沙技术大学)

专题命中 幻觉与鲁棒性 :multimodal large language model(title,abstract);MLLM(abstract)

AI总结 本文提出对抗混淆攻击,通过生成扰动破坏多模态大语言模型的可靠性,展示其在不同模型上的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00706 2025-12-02 cs.CV cs.AI 73%

Optimizing LVLMs with On-Policy Data for Effective Hallucination Mitigation

利用策略数据优化LVLMs以实现有效的幻觉缓解

Chengzhi Yu, Yifan Xu, Yifan Chen, Wenyi Zhang

机构 * University of Science and Technology of China(中国科学技术大学) Hong Kong Baptist University(香港 Baptist 大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);LLaVA(abstract);分类 cs.CV、cs.AI

AI总结 本文提出利用策略数据优化LVLMs,通过幻觉分类器和动态加权DPO算法,显著降低幻觉率并提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19362 2025-12-02 cs.CV cs.AI cs.CL cs.CY cs.LG 69%

LOTUS: A Leaderboard for Detailed Image Captioning from Quality to Societal Bias and User Preferences

LOTUS: 一种用于从质量到社会偏见和用户偏好的详细图像描述的排行榜

Yusuke Hirota, Boyi Li, Ryo Hachiuma, Yueh-Hua Wu, Boris Ivanovic, Yuta Nakashima, Marco Pavone, Yejin Choi, Yu-Chiang Frank Wang, Chao-Han Huck Yang

机构 * NVIDIA Research(NVIDIA研究)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG;VLM(comments)

AI总结 LOTUS是一种用于评估详细图像描述质量、偏见和社会偏见的排行榜,通过定制标准满足不同用户偏好,揭示了模型在不同评估标准上的表现差异。

Comments Accepted to ACL 2025. Leaderboard: huggingface.co/spaces/nvidia/lotus-vlm-bias-leaderboard

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01659 2025-12-02 cs.LG cs.AI cs.CL 62%

HalluGraph: Auditable Hallucination Detection for Legal RAG Systems via Knowledge Graph Alignment

HalluGraph: 通过知识图谱对齐实现法律RAG系统的可审计性幻觉检测

Valentin Noël, Elimane Yassine Seidou, Charly Ken Capo-Chichi, Ghanem Amari

机构 * Devoteam

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI、cs.LG

AI总结 HalluGraph通过知识图谱对齐技术,为法律RAG系统提供可审计的幻觉检测,实现高精度的实体定位和关系验证,提升法律应用场景的可靠性。

Comments 8 pages, 4 figures, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00928 2025-12-02 cs.MM 50%

Augmenting Intra-Modal Understanding in MLLMs for Robust Multimodal Keyphrase Generation

增强多模态大语言模型的模态内理解以实现鲁棒的多模态关键词生成

Jiajun Cao, Qinggang Zhang, Yunbo Tang, Zhishang Xiang, Chang Yang, Jinsong Su

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract)

AI总结 AimKP通过增强模态内语义学习和跨模态对齐,提升多模态关键词生成的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏