arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 2260 信号源:cs.CV, cs.AI, cs.LG

1. 幻觉与鲁棒性 2260 篇

2608.02216 2026-08-04 cs.CV 新提交 79%

Local Margin Restoration for Test-Time Adaptation of Vision-Language Models

用于视觉-语言模型测试时适应的局部间隔恢复

Yan Huang, Guowei Wang, Xu Wang, Kangjun Liu, Xin Lin

机构 * Guangzhou University(广州大学) The Second Affiliated Hospital of Guangzhou University of Chinese Medicine(广州中医药大学第二附属医院) Jinan University(暨南大学) Pengcheng Laboratory(鹏城实验室)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV

AI总结 针对视觉-语言模型测试时分布偏移导致的性能下降问题,提出局部间隔恢复框架,通过样本级受保护间隔恢复与流级双阶段稳定机制,在多数据集上实现优于现有基线的性能。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28211 2026-07-31 cs.CV 新提交 79%

Scaling Vision-Language Models Is Not Enough to Mitigate Bias

扩大视觉-语言模型规模不足以缓解偏见

Ioannis Sarridis, Ioannis Kompatsiaris, Symeon Papadopoulos

机构 * Information Technologies Institute, CERTH(CERTH信息技术研究所)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV

AI总结 该研究通过对194个视觉-语言模型的大规模实证分析,发现扩大模型规模无法缓解偏见,训练数据属性对偏见鲁棒性更关键,架构选择效果依赖基准特性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27897 2026-07-31 cs.CV 新提交 79%

Unifying Adversarially Robust Model Experts in Vision-Language Models

统一视觉-语言模型中的对抗鲁棒模型专家

Nguyen Duc Thai, Junhao Dong, Sua Qi Rong, Hua Yu, Yew-Soon Ong

机构 * College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院) Center for Frontier AI Research, Agency for Science, Technology and Research (A*STAR)(新加坡科技研究局前沿人工智能研究中心)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV

AI总结 针对视觉-语言模型对抗鲁棒性不足问题,提出CARE框架,通过维护并协同微调多个鲁棒模型专家,实现知识融合,在多任务上性能优于单独训练的专家。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04641 2026-07-30 cs.CV 版本更新 79%

CAST: Mitigating Object Hallucination in Large Vision-Language Models via Caption-Guided Visual Attention Steering

CAST:通过字幕引导的视觉注意力调控缓解大型视觉语言模型中的物体幻觉

Qiming Li, Zekai Ye, Xiaocheng Feng, Weihong Zhong, Libo Qin, Ruihan Chen, Lei Huang, Baohang Li, Kui Jiang, Yaowei Wang, Ting Liu, Bing Qin

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV

AI总结 本研究针对大型视觉语言模型的物体幻觉问题,提出无需训练的即插即用方法CAST,通过字幕引导的视觉注意力调控,在低推理成本下平均降低物体幻觉6.03%,实现最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00807 2026-07-30 cs.AI 版本更新 79%

BioPro: Towards Difference-Aware Gender Fairness for Vision-Language Models

BioPro: 关于差分意识的性别公平性在视觉-语言模型中

Yujie Lin, Jiayao Ma, Qingguo Hu, Wenbo Li, Genji Li, Derek Wong, Jinsong Su

机构 * School of Informatics, Xiamen University(厦门大学信息学院) Department of Computer and Information Science, University of Macau(澳门大学计算机与信息科学系)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.AI

AI总结 BioPro通过差分意识的性别公平性方法,在视觉-语言模型中实现选择性去偏,减少中性情境中的性别偏见同时保持显性情境中的性别忠实性。

Comments ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16257 2026-07-27 cs.CV 版本更新 79%

Quality Text, Robust Vision: The Role of Language in Enhancing Visual Robustness of Vision-Language Models

高质量文本,稳健视觉:语言在增强视觉语言模型视觉稳健性中的作用

Futa Waseda, Saku Sugawara, Isao Echizen

机构 * The University of Tokyo(东京大学) National Institute of Informatics(日本信息处理研究所) The University of Tokyo, National Institute of Informatics(东京大学、日本信息处理研究所)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV

AI总结 研究针对视觉语言模型对抗攻击问题,提出质量文本引导的对抗微调方法QT-AFT,利用高质量字幕提升视觉编码器对抗鲁棒性,在多个零样本数据集上实现了最先进的零样本对抗鲁棒性和纯净准确率,并揭示了语言增强视觉鲁棒性的关键见解。

Comments ACMMM 2025 Accepted. Codes are available at: https://github.com/futakw/QTAFT

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21036 2026-07-24 cs.CV 新提交 79%

GeoThreat: Transferable Targeted Adversarial Attacks on Large Vision-Language Models for Remote Sensing Image Interpretation

GeoThreat:用于遥感图像解释的大型视觉语言模型的可转移目标对抗攻击

Yimin Fu, Yuefeng Bai, Baicheng Pan, Zhunga Liu, Michael K. Ng

机构 * Department of Mathematics, Hong Kong Baptist University(香港浸会大学数学系) School of Automation, Northwestern Polytechnical University(西北工业大学自动化学院)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV

AI总结 研究针对大型视觉语言模型在遥感图像解释中的对抗攻击问题,提出GeoThreat方法,通过在概念和感知层面调制对抗表示,结合对抗目标相似性梯度等技术,实现可转移目标对抗攻击,实验证明该方法在可转移性和可控性上具有优越性。

Comments The code will be released at https://github.com/fuyimin96/GeoThreat upon acceptance

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20351 2026-07-23 cs.CV cs.CL 新提交 79%

Test-Time Training for Modality Order Consistency in Vision-Language Models

视觉语言模型中模态顺序一致性的测试时训练

Aditi Gupta, Yossi Gandelsman

机构 * University of Chicago(芝加哥大学)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV

AI总结 研究发现视觉语言模型对图像和问题呈现顺序敏感,利用此设计测试时训练方法,缩小模态顺序差距,使两种顺序相互一致,定位顺序失败区域,证明该方法可缓解故障并提升性能。

Comments 16 pages, 7 figures, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10329 2026-07-14 cs.CV 新提交 79%

Imperceptible and Reversible Adversarial Examples against Vision-Language Models for Privacy Protection

用于隐私保护的针对视觉语言模型的不可察觉且可逆的对抗性示例

Qi Lu, Ziqi Zhou, Yufei Song, Zijing Li, Lulu Xue, Minghui Li, Shengshan Hu, Leo Yu Zhang

机构 * School of Cyber Science and Engineering, Huazhong University of Science and Technology(华中科技大学网络空间安全学院) College of Computer Science, Chongqing University(重庆大学计算机科学学院) School of Software and engineering, Huazhong University of Science and Technology(华中科技大学软件工程学院) School of Information and Communication Technology, Griffith University(格里菲斯大学信息与通信技术学院)

专题命中 幻觉与鲁棒性 :vision-language model(title);vision language model(abstract);分类 cs.CV

AI总结 研究针对视觉语言模型基于文本的隐私攻击问题,提出CloakDiff框架,结合扩散对抗编辑与可逆网络生成不可察觉的对抗性示例,设计EDM启发式采样提高保真度,实验证明该框架能实现多模态隐私保护且具高视觉质量和可逆性。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04356 2026-07-07 cs.CV 版本更新 79%

Stage-wise Attention-Guided Region Sequencing for Adversarial Attacks on Large Vision-Language Models

用于对大型视觉语言模型进行对抗攻击的逐阶段注意力引导区域排序

Jaehyun Kwak, Nam Cao, Boryeong Cho, Segyu Lee, Sumyeong Ahn, Se-Young Yun

机构 * KAIST(韩国科学技术院) KENTECH(KENTECH研究院)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV

AI总结 研究针对大型视觉语言模型的有针对性对抗攻击,基于注意力分析提出逐阶段注意力引导区域排序,介绍了黑盒区域排序框架SAGA,在多个模型上取得了最先进的攻击成功率和最佳不可感知性。

Comments Pre-print

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03177 2026-07-07 cs.CV 版本更新 79%

SAVER: Mitigating Hallucinations in Large Vision-Language Models via Style-Aware Visual Early Revision

SAVER:通过风格感知视觉早期修正减轻大型视觉语言模型中的幻觉

Zhaoxu Li, Chenqi Kong, Yi Yu, Qiangqiang Wu, Xinghao Jiang, Ngai-Man Cheung, Bihan Wen, Alex Kot, Xudong Jiang

机构 * ROSE Lab, Interdisciplinary Graduate Programme, Nanyang Technological University, Singapore(南洋理工大学罗思实验室,跨学科研究生项目,新加坡) ROSE Lab, School of Electrical and Electronic Engineering, Nanyang Technological University, Singapore(南洋理工大学罗思实验室,电子与电气工程学院,新加坡) City University of Hong Kong, Hong Kong SAR(香港城市大学,香港特别行政区) Shanghai Jiao Tong University, China(上海交通大学,中国) Singapore University of Technology and Design, Singapore(新加坡科技设计大学,新加坡) VinUniversity, Hanoi, Vietnam(越南文大学,河内,越南)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV

AI总结 研究大型视觉语言模型幻觉问题,构建含照片及风格化图像数据集并对比,提出SAVER机制,利用早期层反馈基于视觉注意力模式动态调整输出,减轻风格化图像引起的幻觉,实验证明其性能先进。

Comments Accepted at AAAI 2026. 24 pages, 10 figures. Code: https://github.com/llizhaoxu/SAVER

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29232 2026-06-30 cs.CV 79%

When Does Synthetic CT Transfer? A Label-Free Donor/Host Diagnostic for Medical Vision-Language Model Routing on Real Lung CT

合成CT何时迁移?一种无标签的供体/宿主诊断方法用于真实肺CT上的医学视觉-语言模型路由

Fakrul Islam Tushar

专题命中 幻觉与鲁棒性 :vision-language model(title);VLM(abstract_cn);分类 cs.CV

AI总结 本文提出一种无标签方法,通过合成数字双胞胎区分供体驱动和宿主驱动的模型能力,预测合成CT到真实CT的迁移性,并在肺CT视觉-语言任务上验证。

Comments 10 pages, 7 figures, 1 table, 1 supplement

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.08108 2026-06-30 cs.CV cs.CL cs.CR 79%

Exploiting Vision Encoder Vulnerabilities for Universal Adversarial Perturbations on Large Vision-Language Models

利用视觉编码器漏洞对大视觉-语言模型生成通用对抗扰动

Hee-Seon Kim, Minbeom Kim, Seokil Ham, Changick Kim

机构 * KAIST(韩国科学技术院)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV

AI总结 本文研究了大视觉-语言模型在输入图像中对小对抗扰动的脆弱性,提出了一种针对视觉编码器内部组件的通用对抗扰动攻击框架,通过分析注意力机制识别关键脆弱组件,实现高效攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27500 2026-06-29 cs.CV cs.CL 新提交 79%

Aloe-Vision: Robust Vision-Language Models for Healthcare

Aloe-Vision: 面向医疗保健的鲁棒视觉-语言模型

Jaume Guasch-Martí, Enrique Lopez-Cuena, Martín Suárez-Fernández, Jordi Bayarri-Planas, Anna Arias-Duart, Dario Garcia-Gasulla

机构 * Barcelona Supercomputing Center (BSC)(巴塞罗那超级计算中心(BSC))

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV

AI总结 提出Aloe-Vision系列医疗LVLM,通过大规模高质量多模态数据微调,在保持通用能力的同时提升医疗任务性能,并引入低污染基准CareQA-Vision,揭示当前模型在临床环境中的鲁棒性挑战。

Comments MIDL 2026

Journal ref Proceedings of Machine Learning Research, Vol. 315, pp. 2404-2426, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24187 2026-06-25 cs.CV 新提交 79%

Towards Fast and Effective Long Video Understanding of Multimodal Large Language Models via Adaptive Quasi-Gaussian Sampling

面向多模态大语言模型的长视频快速有效理解:自适应准高斯采样

Kun Zhang, Chenxin Fang, Tao Chen, Baiyang Song, Yunhang Shen, Yiyi Zhou, Rongrong Ji

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(厦门大学多媒体可信感知与高效计算教育部重点实验室)

专题命中 幻觉与鲁棒性 :multimodal large language model(title,abstract);分类 cs.CV

AI总结 提出自适应无训练帧采样方法AdaQ,基于高斯分布3-σ规则动态调整采样区间,在仅用64帧下使Qwen3-VL-8B平均超越GPT4o 15.8%,显著提升长视频理解的鲁棒性和效率。

Comments NeurIPS 2026 submission. 15 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15202 2026-06-16 cs.CV 新提交 79%

Comparing Human Gaze and Vision-Language Model Attention in Safety-Relevant Environments

安全相关环境中的人类注视与视觉语言模型注意力的比较

Marta Vallejo, Siwen Wang

机构 * Heriot-Watt University(赫瑞-瓦特大学)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV

AI总结 本研究通过眼动追踪实验和GPT-4o等视觉语言模型,比较了人类与模型在安全相关场景中的注意力分布,发现模型无需训练数据即可近似人类注视模式。

Comments 30 pages, 33 figures. Submitted as a preprint. Code and data available upon reasonable request

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00591 2026-06-16 cs.CV 版本更新 79%

Intrinsic Gradient Suppression for Label-Noise Prompt Tuning in Vision-Language Models

视觉语言模型中标签噪声提示调优的内在梯度抑制

Jiayu Li, Jiaxin Qi, Sheng Zhou, Jiaqiang Huang, Xiansheng Hua

机构 * University of Science and Technology of China(中国科学技术大学) Tsinghua University(清华大学)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV

AI总结 提出双Softmax提示调优(DSPT),通过内在梯度抑制机制自适应压制高错误噪声样本的梯度,实现标签噪声下的鲁棒提示调优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15687 2026-06-11 cs.CL cs.AI 版本更新 79%

ASRU: Activation Steering Meets Reinforcement Unlearning for Multimodal Large Language Models

ASRU:激活引导与强化遗忘融合用于多模态大语言模型

Jiahui Guang, Haiyan Wang, Yingjie Zhu, Cuiyun Gao, Jing Li, Di Shao, Zhaoquan Gu

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 幻觉与鲁棒性 :multimodal large language model(title,abstract);分类 cs.AI

AI总结 ASRU提出一种可控多模态遗忘框架,通过激活引导和强化学习提升多模态大语言模型的遗忘效果和生成质量,实验显示在Qwen3-VL上遗忘效果提升24.6%,生成质量提升5.8倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00349 2026-06-01 cs.AI 79%

Debate with Images: Detecting Deceptive Behaviors in Multimodal Large Language Models

图像辩论:检测多模态大语言模型中的欺骗行为

Sitong Fang, Shiyi Hou, Kaile Wang, Boyuan Chen, Donghai Hong, Jiayi Zhou, Josef Dai, Yaodong Yang, Jiaming Ji

机构 * Institute of Artificial Intelligence, Peking University(北京大学人工智能研究院)

专题命中 幻觉与鲁棒性 :multimodal large language model(title,abstract);分类 cs.AI

AI总结 本文提出 MM-DeceptionBench 基准和基于图像辩论的多智能体监控框架,系统揭示并量化多模态大语言模型中的欺骗风险,有效提升欺骗行为检测能力。

Comments 39 pages, 16 figures, camera ready version for ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.14279 2026-05-29 cs.CV cs.CL 79%

Looking Beyond Text: Reducing Language bias in Large Vision-Language Models via Multimodal Dual-Attention and Soft-Image Guidance

超越文本:通过多模态双注意力和软图像引导减少大型视觉语言模型中的语言偏差

Haozhe Zhao, Shuzheng Si, Liang Chen, Yichi Zhang, Maosong Sun, Mingjia Zhang, Baobao Chang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Peking University(北京大学) Tsinghua University(清华大学)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV

AI总结 针对大型视觉语言模型因语言偏差导致的幻觉问题,提出LACING框架,采用多模态双注意力机制和软图像引导策略,在不增加训练资源的情况下增强视觉理解并减少幻觉。

Comments EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28347 2026-05-28 cs.AI 79%

FedMPT: Federated Multi-label Prompt Tuning of Vision-Language Models

FedMPT: 视觉语言模型的多标签联邦提示调优

Xucong Wang, Pengkun Wang, Zhe Zhao, Liheng Yu, Shuang Wang, Yang Wang

机构 * University of Science and Technology of China(科学技术大学)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.AI

AI总结 针对联邦学习中多标签识别任务,提出FedMPT方法,利用因果模型的前门调整和大语言模型驱动的条件解耦,通过最优传输和门控机制抑制虚假标签关联,提升模型鲁棒性。

Comments 16 pages, including 11 pages of main text and 5 pages of appendix; Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25922 2026-05-26 cs.CV 79%

Closed-Loop Bidirectional Prompting for Adversarial Robustness of Vision Language Models

闭环双向提示用于视觉语言模型的对抗鲁棒性

Xiao Liu, Jiaxiang Liu, Boci Peng, Boren Hu, Yusong Wang, Xiwen Chen, Prayag Tiwari, Liming Zhang, Mingkun Xu

机构 * University of Macau(澳门大学) Guangdong Institute of Intelligence Science and Technology(广东智能科学与技术研究院) Peking University(北京大学) Independent Researcher(独立研究员) Institute of Science Tokyo(东京科学研究院) Morgan Stanley(摩根大通) Halmstad University(哈马碧大学)

专题命中 幻觉与鲁棒性 :vision language model(title,abstract);分类 cs.CV

AI总结 针对视觉语言模型在对抗扰动下跨模态语义对齐脆弱的问题,提出闭环双向提示方法,通过动态反馈循环恢复跨模态一致性,并引入语义锚点约束循环更新,实现实例自适应保护,在11个数据集上达到最先进的鲁棒性和泛化性能。

Comments 24 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24024 2026-05-26 cs.CV 79%

Mitigating Hallucinations in Large Vision-Language Models via Causal Route Gating

通过因果路由门控减轻大型视觉语言模型中的幻觉

Zhe Cheng, Wenyu Chen, Fode Zhang, Dehuan Shen

机构 * Center of Statistical Research, School of Statistics and Data Science, Southwestern University of Finance and Economics, Chengdu, China.(统计研究中心,统计与数据科学学院,西南财经大学,成都,中国) Department of Biomedical Engineering, College of Design and Engineering, National University of Singapore, Singapore(生物医学工程系,设计与工程学院,新加坡国立大学,新加坡)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV

AI总结 针对大型视觉语言模型中因文本路径主导导致幻觉的问题,提出一种无训练、决策对齐的干预方法,通过分解注意力头为视觉和文本路由并抑制文本路由,有效减少幻觉错误。

Comments Accepted as a Spotlight Paper at ICML 2026. 33 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20469 2026-05-21 cs.CV 79%

HalluCXR: Benchmarking and Mitigating Hallucinations in Medical Vision-Language Models for Chest Radiograph Interpretation

HalluCXR: 评估和缓解医疗视觉-语言模型在胸部X光解读中的幻觉

Haoyu Wang, Zitong Li

机构 * Department of Biostatistics & Health Informatics, Institute of Psychiatry, Psychology & Neuroscience, King’s College London(生物统计学与健康信息学系,精神病学、心理学与神经科学研究所,伦敦国王学院)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV

AI总结 本文提出HalluCXR基准,评估六种不同架构的视觉-语言模型在856例分层MIMIC-CXR胸部X光图像上的表现,发现61.9%-82.3%的输出存在幻觉,其中80.2%存在临床危险错误,通过引入幻觉分类学、检测管道和模型集成方法,提出了缓解幻觉的策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19956 2026-05-20 cs.CV 79%

Towards Fine-Grained Robustness: Attention-Guided Test-Time Prompt Tuning for Vision-Language Models

迈向细粒度鲁棒性:面向视觉-语言模型的注意力引导测试时提示调优

Jia-Wei Hai, Yijun Wang, Xiu-Shen Wei

机构 * School of Computer Science and Engineering(计算机科学与工程学院) Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications(新一代人工智能技术及其交叉应用重点实验室) Southeast University(东南大学) School of Intelligence Science and Engineering(智能科学与工程学院)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV

AI总结 本文提出了一种注意力引导的测试时提示调优方法(A-TPT),旨在解决视觉-语言模型在对抗攻击下的鲁棒性问题,通过改进的梯度注意力机制和空间变化的增强强度来提升模型在细粒度场景下的表现。

Comments Accepted by ICML 2026, Project Page: this https, URL Code URL: this https URL

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02784 2026-05-20 cs.CV cs.CL 79%

EnsemHalDet: Robust VLM Hallucination Detection via Ensemble of Internal State Detectors

EnsemHalDet: 通过内部状态检测器的集成实现鲁棒的视觉语言模型幻觉检测

Ryuhei Miyazato, Shunsuke Kitada, Kei Harada

机构 * The University of Electro-Communications(电通大学)

专题命中 幻觉与鲁棒性 :VLM(title);vision-language model(abstract);分类 cs.CV

AI总结 本文提出EnsemHalDet,一种通过集成多个内部表示的视觉语言模型幻觉检测框架,以提高多模态幻觉检测的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17577 2026-05-19 cs.CV 79%

TAME: Test-Time Adversarial Prompt Tuning via Mixture-of-Experts for Vision-Language Models

TAME: 通过混合专家架构实现视觉语言模型的测试时对抗提示调优

Xin Wang, Yixu Wang, Jiaming Zhang, Ruofan Wang, Jiaqi Yu, Kai Chen, Jingjing Chen, Xingjun Ma, Yu-Gang Jiang

机构 * Fellow, IEEE(IEEE会士)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV

AI总结 本文提出TAME,一种基于混合专家架构的测试时防御方法,旨在提升视觉语言模型在对抗扰动下的鲁棒性,同时保持对清洁样本的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15584 2026-05-18 cs.CV 79%

AGC: Adaptive Geodesic Correction for Adversarial Robustness on Vision-Language Models

AGC:面向视觉-语言模型对抗鲁棒性的自适应测地修正

Zhiwei Li, Jiacheng Xue, Weining Wang, Ajian Liu, Xingyu Gao, Zhenan Sun, Qi Li

机构 * NLPR & MAIS, Institute of Automation, Chinese Academy of Sciences(自动化研究所国家工程研究中心与人工智能院,中国科学院) School of Computer Science and Engineering, Central South University(中南大学计算机科学与工程学院) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV

AI总结 本文提出AGC,一种无需训练的防御机制,通过自适应步长修正输入特征,提升视觉-语言模型的对抗鲁棒性,实测在八个细粒度数据集上提升44.4%的鲁棒准确率,同时降低10倍推理延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10744 2026-05-12 cs.CV cs.RO 79%

C-CoT: Counterfactual Chain-of-Thought with Vision-Language Models for Safe Autonomous Driving

C-CoT:基于视觉-语言模型的反事实链式推理用于安全自动驾驶

Kefei Tian, Yuansheng Lian, Kai Yang, Xiangdong Chen, Shen Li

机构 * College of Transportation, Tongji University(同济大学交通运输学院) Department of Civil Engineering, Tsinghua University(清华大学土木工程系) School of Vehicle and Mobility, Tsinghua University(清华大学车辆与移动系统学院) Department of Civil and Environmental Engineering, National University of Singapore(新加坡国立大学土木与环境工程系)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV

AI总结 本文提出C-CoT框架,利用视觉-语言模型将驾驶决策分解为五个阶段,通过反事实推理提升自动驾驶在复杂环境中的安全性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.04077 2026-05-12 cs.CV 79%

H-POPE: Hierarchical Polling-based Probing Evaluation of Hallucinations in Large Vision-Language Models

H-POPE:基于分层轮询的大型视觉-语言模型幻觉评估

Nhi Pham, Michael Schott

机构 * Max Planck Institute for Informatics(马克斯·普朗克信息研究所) Saarland University(萨尔兰州大学) Zuse School(祖斯学校)

专题命中 幻觉与鲁棒性 :vision-language model(title);vision language model(abstract);分类 cs.CV

AI总结 H-POPE通过文本和图像结合的方式评估大型视觉-语言模型的幻觉问题,发现模型在物体存在和细粒度属性上易出现幻觉,且依赖视觉输入生成文本。

Comments Poster at https://sites.google.com/berkeley.edu/bb-stat/home

详情

展开后加载摘要…

URL PDF HTML 收藏