On Large Visual Language Models for Medical Imaging Analysis: An Empirical Study
专题命中 幻觉与鲁棒性 :visual language model(title,abstract);LLaVA(abstract);分类 cs.CV、cs.AI
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 幻觉与鲁棒性 :visual language model(title,abstract);LLaVA(abstract);分类 cs.CV、cs.AI
专题命中 幻觉与鲁棒性 :multimodal large language model(title,abstract);LLaVA(abstract);分类 cs.CV、cs.LG
专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);LLaVA(abstract);分类 cs.CV、cs.LG
Comments NeurIPS 2023
机构 * UC Berkeley(加州大学伯克利分校) ; POSTECH
专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);VLM(abstract,comments);分类 cs.CV
Comments Accepted to NeurIPS 2025; Project Page: https://reverse-vlm.github.io
机构 * University of Western Australia(西澳大学) ; University of Melbourne(墨尔本大学) ; Australian National University(澳大利亚国立大学)
专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV
Comments Keywords: Vision-Language Models, Frequency-Domain Perturbations, Adversarial Robustness, Image Authenticity, Reliability
专题命中 幻觉与鲁棒性 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.AI
Comments Multimodal Large Language Models Defense, 25 Pages
MM-PoisonRAG:通过局部和全局投毒攻击破坏多模态RAG
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; University of California Los Angeles(加州大学洛杉矶分校)
专题命中 幻觉与鲁棒性 :MLLM(abstract,abstract_cn);grounding(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 提出MM-PoisonRAG框架,通过局部投毒攻击(LPA)和全局投毒攻击(GPA)两种策略,系统研究多模态检索增强生成(RAG)在知识投毒下的脆弱性,实验表明攻击成功率高达56%且能绕过现有防御。
Comments Code is available at https://github.com/HyeonjeongHa/MM-PoisonRAG
相同模型,不同弱点:语言与模态如何重塑前沿多模态大语言模型的越狱攻击面
机构 * Appen(Appliance)
专题命中 幻觉与鲁棒性 :MLLM(summary_cn,abstract);multimodal large language model(abstract)
AI总结 通过跨语言多模态红队测试,发现语言和模态通过不同机制影响越狱漏洞,导致安全排名跨语言不守恒,需重新设计评估框架。
迈向更可靠的人工智能:减少视觉-语言模型中的幻觉
机构 * Department of CS AI and Data Science(计算机科学与数据科学系) ; ESEO Engineering School(ESEO工程学院) ; Faculty of Law, Economy, Management(法学院、经济与管理学院)
专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.AI、cs.LG;VLM(comments)
AI总结 本文提出无需训练的自我纠正框架,通过不确定性引导的视觉再注意力减少视觉-语言模型中的幻觉,提升响应准确性。
Comments 24 pages, 3 figures, 2 tables. Training-free self-correction framework for vision-language models. Code and implementation details will be released at: https://github.com/kassoumsanogo1/self-correcting-vlm-re-Attention.git
Journal ref The 4th National and International Academic Conference Celebrating the 20th Anniversary of Rajapruk University (2026)
当无关文本起作用时:多模态大语言模型中的仿射间隔偏移
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 幻觉与鲁棒性 :multimodal large language model(title,abstract);分类 cs.CV
AI总结 本文研究多模态大语言模型(MLLMs)中任务无关文本对视觉判断任务的影响,发现其会使模型决策间隔发生可预测的仿射变换,为提升模型对噪声上下文的鲁棒性提供了诊断基础。
专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV
Comments 5 pages,3 figures, 1 table, CVPR DriveX workshop
Journal ref DriveX Workshop at IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2026
COMIC:面向多模态大语言模型的参考感知安全门控
专题命中 幻觉与鲁棒性 :multimodal large language model(title,abstract);grounding(abstract);分类 cs.AI
AI总结 本研究针对多模态大语言模型的参考依赖型安全缺陷,提出COMIC参考感知安全门控,通过解析操作-目标对评估安全性,提升了模型鲁棒性且保留良性效用。
T-VSS:面向视觉语言模型对抗鲁棒性的测试时视觉子空间引导
机构 * School of Electrical Engineering, KAIST(韩国科学技术院电气工程学院)
专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);VLM(abstract_cn);分类 cs.CV
AI总结 提出T-VSS方法,通过在视觉特征空间中构建样本特定的低秩子空间并学习共享特征校正,直接适应受攻击特征,提升视觉语言模型的对抗鲁棒性,同时保持清洁准确率和效率。
评估视觉-语言模型在视觉和文本扰动下的诊断鲁棒性
机构 * University of Tehran(德黑兰大学) ; Tehran University of Medical Sciences(德黑兰医科大学) ; Advanced Diagnostic and Interventional Radiology Research Center (ADIR)(高级诊断与介入放射学研究中心(ADIR))
专题命中 幻觉与鲁棒性 :vision-language model(title);VLM(abstract,abstract_cn);分类 cs.CV
AI总结 本研究通过脑部MRI数据集评估四类视觉-语言模型在视觉、文本扰动下的诊断鲁棒性,发现其存在预测翻转、文本选择偏差、诊断过度承诺等问题,指出需采用稳定性指标评估其临床应用可靠性。
SIGNPOST-Bench:评估多模态大语言模型文本-视觉冲突解决能力的基准
专题命中 幻觉与鲁棒性 :multimodal large language model(title,abstract);MLLM(abstract_cn);分类 cs.CV
AI总结 本研究推出SIGNPOST-Bench基准,通过包含5111个反事实组的25555个图像变体,评估20个多模态大语言模型的文本-视觉冲突解决能力,发现对抗文本会显著提升定位误差,且模型对冲突文本的鲁棒性无法由干净输入的定位性能完全预测。
Comments 27 pages, 25 figures
HalluScope:多模态大语言模型的细粒度幻觉诊断
机构 * Peking University(北京大学) ; Joy Future Academy(京东探索研究院)
专题命中 幻觉与鲁棒性 :multimodal large language model(title,abstract);LLaVA(abstract);分类 cs.CV
AI总结 研究针对多模态大语言模型的幻觉问题,提出细粒度幻觉诊断任务,开发数据集并设计奖励函数,训练HalluScope-4B和HalluScope-8B模型,在多个基准测试中达最优,其诊断解释能有效指导目标模型纠正幻觉。
Comments Accepted to ACM Multimedia 2026 (ACM MM 2026)
在放弃之前再看一眼:预算约束下的共形证据获取用于可靠的视觉-语言模型
机构 * South China University of Technology(华南理工大学) ; RIKEN Center for Advanced Intelligence Project(RIKEN先进智能研究中心) ; Columbia University(哥伦比亚大学)
专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);VLM(abstract_cn);分类 cs.CV
AI总结 针对视觉-语言模型幻觉问题,提出预算约束共形证据获取(BCEA)方法,通过三级决策(回答、放弃或获取额外视觉证据)在有限计算预算下控制幻觉率,并恢复有限样本保证。
VOPE:重新审视视觉语言模型在自愿想象任务中的幻觉现象
机构 * Key Laboratory of AI Safety of CAS, Institute of Computing Technology, Chinese Academy of Sciences (CAS)(中国科学院人工智能安全重点实验室,计算技术研究所,中国科学院) ; University of Chinese Academy of Sciences(中国科学院大学) ; Zhongguancun Academy(中关村学院)
专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);grounding(abstract);分类 cs.CV
AI总结 研究聚焦视觉语言模型在自愿想象任务中的幻觉问题,引入VOPE评估基准,通过构建数据集应用于主流模型和缓解方法,发现多数模型幻觉严重,现有缓解方法效果有限,为该领域未来研究指明重要方向。
Comments Accepted at ACM MM 2026 Dataset Track
SteelBench:真实工业环境下的视觉语言模型评估基准
机构 * Indian Institute of Technology Bhilai(印度理工学院比莱分校) ; Steel Authority of India Limited(印度钢铁管理局有限公司) ; VIT Vellore(维洛尔理工学院)
专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV
AI总结 针对现有基准无法适配真实工业监控场景的问题,构建含1345条标注片段的SteelBench基准,评估视觉语言模型的工业活动识别、安全规则推理等能力,发现现有模型性能远低于人类水平。
6根手指,1个肾脏:自然对抗性医学图像揭示视觉语言模型的关键弱点
机构 * German Cancer Research Center (DKFZ) Heidelberg, Division of Intelligent Medical Systems(德国癌症研究中心(DKFZ)海德堡,智能医学系统部门) ; Medical Faculty, Heidelberg University(海德堡大学医学院) ; Faculty of Mathematics and Computer Science, Heidelberg University(海德堡大学数学与计算机科学学院) ; HIDSS4Health - Helmholtz Information and Data Science School for Health, Karlsruhe/Heidelberg(HIDSS4Health - 哈勃-马克斯信息与数据科学健康学院,卡尔斯鲁厄/海德堡) ; Helmholtz Imaging, German Cancer Research Center (DKFZ)(哈勃-马克斯成像,德国癌症研究中心(DKFZ)) ; Engineering Faculty, Heidelberg University(海德堡大学工程学院) ; School of Computation, Information and Technology, TUM(技术大学(TUM)计算、信息与技术学院) ; Weldon School of Biomedical Engineering, Purdue University(普渡大学韦尔登生物医学工程学院) ; Department of Visceral, Thoracic and Vascular Surgery, University Hospital and Faculty of Medicine Carl Gustav Carus, TUD Dresden University of Technology(visceral、胸腔和血管外科部门,技术大学(TUD)德累斯顿大学医院和医学院) ; National Center for Tumor Diseases (NCT), NCT Heidelberg, a partnership between DKFZ and University Hospital Heidelberg(肿瘤疾病国家中心(NCT),海德堡NCT,DKFZ与海德堡大学医院之间的合作) ; Heidelberg University Hospital, Surgical Clinic, Surgical AI Research Group(海德堡大学医院,外科诊所,外科人工智能研究组) ; Mohamed Bin Zayed University of Artificial Intelligence (MBZUAI), Abu Dhabi, UAE(Mohamed Bin Zayed人工智能大学(MBZUAI),阿布扎赫,阿拉伯联合酋长国)
专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);VLM(abstract_cn);分类 cs.CV
AI总结 提出AdversarialAnatomyBench基准,测试25个视觉语言模型在罕见解剖变异上的表现,发现准确率从71%降至28%,且模型缩放和干预无法解决。
FUSE: 通过贝叶斯融合认知不确定性和偶然不确定性来量化视觉语言模型中的不确定性
机构 * Massachusetts Institute of Technology(麻省理工学院)
专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);VLM(abstract_cn);分类 cs.CV
AI总结 提出FUSE概率框架,通过贝叶斯融合视觉语言模型中的偶然不确定性和认知不确定性,生成标量不确定性度量,用于可靠预测输出正确性,实现SOTA不确定性校准。
将视觉-语言模型从标志性适应到包容性:用于无标签的多标签识别
机构 * State Key Laboratory of Virtual Reality Technology and Systems, SCSE & QRI, Beihang University(虚拟现实技术与系统国家重点实验室,北京航空航天大学计算机学院与青岛研究院)
专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);VLM(abstract_cn);分类 cs.CV
AI总结 提出无监督框架,通过“切割”和“缝合”两阶段适应VLMs,实现无标签的多标签图像识别,在四个数据集上超越现有无监督方法。
对抗攻击已揭示答案:面向视觉语言模型的定向偏差引导测试时防御
机构 * University of Science and Technology of China(中国科学技术大学) ; National Key Laboratory of Deep Space Exploration, Deep Space Exploration Laboratory(国家深空探测重点实验室,深空探测实验室) ; The Chinese University of Hong Kong(香港中文大学) ; Zhejiang University(浙江大学) ; Ant Group(蚂蚁集团)
专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);VLM(abstract_cn);分类 cs.CV
AI总结 提出定向偏差引导防御(DBD),利用对抗样本在CLIP特征空间中沿主导方向偏移的现象,通过估计防御方向并采用DB分数双流重建策略恢复鲁棒表示,在15个数据集上实现最先进对抗鲁棒性且保持干净准确率。
Comments Accepted by ICLR2026
YARD: Y型架构寄存器解码用于大型视觉语言模型中的高效幻觉缓解
机构 * Guangdong University of Technology(广东工业大学) ; Nanyang Technological University(南洋理工大学) ; Shenzhen TENCLASS Technology Co., Ltd.(深圳TENCLASS科技有限公司)
专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);grounding(abstract);分类 cs.CV
AI总结 提出YARD框架,通过Y型架构共享浅层计算并在中间层分支,用寄存器令牌替换视觉令牌构建退化分支,实现无需训练的对比解码,有效缓解幻觉并降低推理延迟。
Comments 21 pages, 11 figures
面向不完整多模态输入的统一视觉-语言模型
机构 * School of Software Engineering, Huazhong University of Science and Technology(华中科技大学软件工程学院) ; Nanyang Technological University, Singapore(新加坡南洋理工大学) ; University College London(伦敦大学学院) ; Guangzhou University(广州大学) ; Wuhan University(武汉大学) ; Nanjing University(南京大学)
专题命中 幻觉与鲁棒性 :vision-language model(title);VLM(abstract,abstract_cn);分类 cs.CV
AI总结 针对视频-语言模型在传感器失效导致模态不完整数据下的训练-测试不一致问题,提出首个统一的不完整视频-语言模型作为即插即用模块,提升多模态任务性能。
Comments Published in AAAI 2026
视觉语言模型中物体幻觉的双路径电路
机构 * UIUC(伊利诺伊大学香槟分校) ; UMich(密歇根大学) ; Stanford(斯坦福大学) ; HKUST(香港科技大学) ; PKU(北京大学) ; NUS(新加坡国立大学) ; Marquette(马quette大学) ; Southampton(南安普顿大学)
专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);grounding(abstract);分类 cs.CV
AI总结 研究通过双路径电路分析框架揭示视觉语言模型中物体幻觉的机制,发现视觉接地路径与幻觉路径的交互特性,并通过抑制幻觉路径组件降低幻觉发生率。
Med-StepBench:一种用于评估医学视觉-语言模型幻觉的分层推理框架
机构 * AI4LIFE, Hanoi University of Science and Technology, Vietnam(AI4LIFE,越南科学与技术大学) ; SAMOVAR, Télécom SudParis, Institut Polytechnique de Paris, France(SAMOVAR,法国电信南巴黎学院,巴黎理工学院) ; Military Central Hospital, Vietnam(越南108军中心医院)
专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);grounding(abstract);分类 cs.CV
AI总结 本文提出Med-StepBench,首个针对3D肿瘤PET/CT图像的分步幻觉检测基准,通过12000张图像和100万对图像-陈述数据,揭示了现有VLMs在多步临床推理中的系统性缺陷。
Comments Accepted at IJCAI-ECAI 2026
结构化视觉叙事削弱多模态大语言模型的安全对齐
机构 * Singapore University of Technology and Design(新加坡技术与设计大学)
专题命中 幻觉与鲁棒性 :multimodal large language model(title,abstract);visual reasoning(abstract);分类 cs.AI
AI总结 研究发现结构化视觉叙事在多模态大语言模型中导致安全对齐问题,通过漫画模板劫持攻击展示其危害,揭示现有防御方法在处理非有害敏感内容时的不可靠性。
Comments Code released at: https://github.com/Social-AI-Studio/ComicJailbreak
在像素之间阅读:将文本-图像嵌入对齐与字体攻击成功性联系起来
机构 * Cisco Systems(思科系统)
专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV
AI总结 研究了视觉-语言模型中字体提示注入攻击的影响,发现字体大小、文本攻击有效性及嵌入距离对攻击成功率有显著影响,为防御策略提供实证指导。
Comments Accepted at ICLR 2026 Workshop on Agents in the Wild
HTDC: 通过犹豫触发的微分校准缓解大视觉-语言模型中的幻觉
机构 * Sichuan University(四川大学)
专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);grounding(abstract);分类 cs.CV
AI总结 本文提出HTDC,一种无需训练的解码框架,通过检测层间犹豫信号,仅在易出错步骤激活校准,有效抑制幻觉并保持任务准确性。
Comments 10 pages, 4 figures, 6 tables