arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 2260 信号源:cs.CV, cs.AI, cs.LG

1. 幻觉与鲁棒性 2260 篇

2606.03793 2026-08-12 cs.CL cs.CV 版本更新 81%

Exploring Adversarial Robustness and Safety Alignment in Multilingual Multi-Modal Large Language Models

探索多语言多模态大语言模型的对抗鲁棒性与安全对齐

Hashmat Shadab Malik, Muzammal Naseer, Salman Khan

机构 * Mohamed Bin Zayed University of AI, UAE(穆罕默德·本·扎耶德人工智能大学,阿联酋) Khalifa University, UAE(卡比拉大学,阿联酋) Australian National University, Australia(澳大利亚国立大学,澳大利亚)

专题命中 幻觉与鲁棒性 :MLLM(abstract,abstract_cn);grounding(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 本研究通过梯度攻击和跨语言评估,发现多语言多模态大语言模型存在可迁移的对抗脆弱性,并揭示低资源语言因理解失败而呈现的虚假安全现象,提出深层训练整合才能实现真正的多语言安全对齐。

Journal ref The 37th British Machine Vision Conference (BMVC) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00975 2026-08-04 cs.CV 新提交 81%

MonitorVLM-v2: A Deployed Vision-Language Framework for Real-Time Safety Violation Detection

MonitorVLM-v2:用于实时安全违规检测的已部署视觉-语言框架

Jiang Wu, Sichao Wu, Yinsong Ma, Lifang Zheng, Jingliang Duan

机构 * School of Mechanical Engineering, University of Science and Technology Beijing(北京科技大学机械工程学院) The Laboratory for Computational Sensing and Robotics, Johns Hopkins University(约翰霍普金斯大学计算传感与机器人实验室)

专题命中 幻觉与鲁棒性 :VLM(summary_cn,abstract);分类 cs.CV

AI总结 本文提出MonitorVLM-v2框架,将VLM安全评估转化为有限符号空间概率推理,结合SymPO算法与熵驱动分类机制,在地下矿部署中实现19.45倍提速,确认违规量达人工检查的2.78倍,满足实时可审计工业监控需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09492 2026-07-13 cs.AI 新提交 81%

Multimodal Reward Hacking in Reinforcement Learning

强化学习中的多模态奖励黑客攻击

Jiayu Yao, Yiwei Wang, Anmeng Zhang, Zhe Sun, Songsong Wang, Lingrui Mei, Yuyao Ge, Shenghua Liu

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of California, Merced(加州大学默塞德分校) Southeast University(东南大学)

专题命中 幻觉与鲁棒性 :MLLM(abstract,abstract_cn);VLM(abstract);multimodal large language model(abstract);分类 cs.AI

AI总结 研究强化学习中多模态奖励黑客攻击问题,通过引入新奖励失败率(NRFR)等方法,在多种设置下改变模型规模、算法等因素进行实验,发现仅结果奖励易导致黑客攻击,扩大规模可减少但不能消除,还得出不同算法和奖励方式对黑客攻击的影响及相关结论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11874 2026-06-11 cs.AI 新提交 81%

AutoMine Solution for AV2 2026 Scenario Mining Challenge

AutoMine 解决方案:面向 AV2 2026 场景挖掘挑战

Songliang Cao, Jiele Zhao, Yuru Wang, Hao Li, Daqi Liu, Zehan Zhang, Fangzhen Li, Yu Wang, Yue Zhang, Bing Wang, Guang Chen, Hao Lu, Hangjun Ye

机构 * Xiaomi EV(小米汽车) Huazhong University of Science and Technology(华中科技大学)

专题命中 幻觉与鲁棒性 :VLM(summary_cn,abstract);分类 cs.AI

AI总结 提出基于 LLM 和 VLM 的自优化场景挖掘方法 AutoMine,通过语义保持提示增强、鲁棒轨迹原子函数与 VLM 函数结合以及执行反馈优化,在 CVPR 2026 挑战赛中取得领先性能。

Comments CVPR 2026 Scenario Mining Challenge (Temporal Track Winners)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08277 2026-06-09 cs.CV 新提交 81%

Remember with Confidence: Uncertainty Quantification for Spatio-temporal Memory with Probabilistic Guarantees

自信记忆:具有概率保证的时空记忆不确定性量化

Harry Zhang, Nicolas Gorlo, Luca Carlone

机构 * MIT(麻省理工学院)

专题命中 幻觉与鲁棒性 :VLM(summary_cn,abstract);分类 cs.CV

AI总结 针对机器人长期操作中VLM描述噪声大、视角不一致的问题,提出目标级语义不确定性评分,并集成到UQ-DAAAM系统中,通过主动选择高质量视图和融合多视角描述来降低不确定性,同时提供概率保证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25534 2026-05-26 cs.AI 81%

StructBreak: Structural Cognitive Overload-Induced Safety Failures in MLLMs

StructBreak: 多模态大语言模型中结构性认知过载引发的安全故障

Yang Luo, Xinran Liu, Tiantian Ji, Zhiyi Yin, Lingyun Peng, Shuyu Li

机构 * Key Laboratory of Trustworthy Distributed Computing and Service (MoE), Beijing University of Posts and Telecommunications(可信分布式计算与服务重点实验室(MoE),北京邮电大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)

专题命中 幻觉与鲁棒性 :MLLM(summary_cn,abstract_cn);multimodal large language model(abstract);分类 cs.AI

AI总结 提出StructBreak框架,通过量化结构性认知过载(SCO)揭示一种高阶认知过载攻击范式,在六种主流MLLM上实现92%平均攻击成功率,并证明该攻击通过结构性通道绕过安全过滤器。

Comments 23 pages; accepted to Findings of ACL 2026. This paper contains examples of harmful content

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10466 2026-04-20 cs.CV 81%

Art3D: Training-Free 3D Generation from Flat-Colored Illustration

Art3D: 无需训练的从平面着色插图生成3D

Xiaoyan Cong, Jiayi Shen, Zekun Li, Rao Fu, Tao Lu, Srinath Sridhar

机构 * Brown University(布朗大学)

专题命中 幻觉与鲁棒性 :VLM(summary_cn,abstract);分类 cs.CV

AI总结 Art3D通过结合预训练2D图像生成模型和基于VLM的现实感评估,将平面着色插图提升为3D,解决了传统方法在处理无3D illusion的参考图像时的局限性,展示了其在多种绘画风格中的适应性。

Comments Technical Report. Project Page: https://joy-jy11.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02629 2025-08-07 cs.RO cs.AI cs.CL 81%

HyCodePolicy: Hybrid Language Controllers for Multimodal Monitoring and Decision in Embodied Agents

Yibin Liu, Zhixuan Liang, Zanxin Chen, Tianxing Chen, Mengkang Hu, Wanxi Dong, Congsheng Xu, Zhaoming Han, Yusen Qin, Yao Mu

专题命中 幻觉与鲁棒性 :vision-language model(abstract);VLM(abstract);grounding(abstract);multimodal large language model(abstract)

Comments Accepted to ICCV 2025 Workshop on Multi-Modal Reasoning for Agentic Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17306 2026-08-19 cs.CV cs.AI 新提交 81%

Learning What Not to Learn: Adversarial Disentangled Prompt Tuning for Robust Vision-Language Models

学习无需学习的内容:用于鲁棒视觉-语言模型的对抗性解耦提示调优

Yang Chen, Zhan Zhuang, Yanbin Wei, Zebin Chen, Hua Liu, Yu Zhang

机构 * Southern University of Science and Technology(南方科技大学) City University of Hong Kong(香港城市大学) Hong Kong University of Science and Technology(香港科技大学)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 针对现有对抗性提示调优存在的鲁棒泛化过拟合问题,提出ADAPT框架,通过双提示机制解耦鲁棒与伪鲁棒特征,提升模型对未见类别对抗样本的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29418 2026-08-12 cs.CV cs.AI 版本更新 81%

Covert Visual Prompt Injection against Commercial Multimodal Large Language Models

对抗性提示注入攻击多模态大语言模型

Meiwen Ding, Song Xia, Chenqi Kong, Xudong Jiang

机构 * Rapid-Rich Object Search Lab, School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电气与电子工程学院快速丰富目标搜索实验室)

专题命中 幻觉与鲁棒性 :multimodal large language model(title,abstract);分类 cs.CV、cs.AI

AI总结 本文研究了针对强大闭源多模态大语言模型的不可察觉视觉提示注入攻击,通过界文本叠加嵌入恶意提示并优化视觉扰动,提升攻击性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01753 2026-08-04 cs.CV cs.AI 新提交 81%

Can Urban Blight Be Accessed with Vision-language Models: A Case Study in Detroit

能否用视觉-语言模型评估城市衰败:以底特律为例

Xiaohao Yang, Aohua Tian, Derek Van Berkel, Xu Qiang, Mark Lindquist

机构 * School for Environment and Sustainability(环境与可持续发展学院) School of Information(信息学院) University of Michigan(密歇根大学)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 本研究以底特律为案例,提出基于开源大视觉-语言模型的多视角住宅衰败评估框架,经实验验证该框架可低成本跟踪住房状况,为传统调查提供补充。

Comments 19 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16557 2026-07-31 cs.LG cs.CL cs.CV 版本更新 81%

S-GRPO: Unified Post-Training for Large Vision-Language Models

S-GRPO:面向大视觉语言模型的统一后训练方法

Yuming Yan, Kai Tang, Sihong Chen, Ke Xu, Dan Hu, Qun Yu, Pengfei Hu

机构 * Tencent(腾讯)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.LG

AI总结 本文提出S-GRPO,结合模仿学习指导与偏好优化的多轨迹探索,通过条件真实轨迹注入机制解决SFT与RL的效率问题,提升收敛速度与领域适应能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12055 2026-07-31 cs.CV cs.LG 版本更新 81%

Continual Learning with Vision-Language Models via Semantic-Geometry Preservation

通过语义-几何保持实现视觉-语言模型的持续学习

Chiyuan He, Zihuan Qiu, Fanman Meng, Runtong Zhang, Linfeng Xu, Qingbo Wu, Hongliang Li

机构 * School of Information and Communication Engineering, University of Electronic Science and Technology of China(电子科技大学信息与通信工程学院)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.LG

AI总结 本文提出SeGP-CL方法,通过构建对抗锚点和跨模态几何蒸馏,解决持续学习中的语义几何退化问题,提升模型稳定性和迁移能力。

Comments Accepted by IEEE TCSVT 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06931 2026-07-22 cs.CV cs.AI cs.CL 81%

Measuring Social Bias in Vision-Language Models with Face-Only Counterfactuals from Real Photos

通过真实照片生成面部-only反事实来衡量视觉语言模型中的社会偏见

Haodong Chen, Qiang Huang, Jiaqi Zhao, Qiuping Jiang, Xiaojun Chang, Jun Yu

机构 * School of Intelligence Science and Engineering, Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)智能科学与工程学院) School of Information Science and Engineering, Ningbo University(宁波大学信息科学与工程学院) School of Information Science and Technology, University of Science and Technology of China(中国科学技术大学信息科学与技术学院)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出通过真实照片生成面部-only反事实来评估视觉语言模型中的社会偏见,构建了FOCUS数据集和REFLECT基准,发现严格视觉控制下仍存在种族性别差异,强调了反事实审计和任务设计的重要性。

Comments 18 pages, 18 figures, and 3 tables

Journal ref Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), pp. 39963-39987, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29759 2026-07-17 cs.CV cs.AI 版本更新 81%

TSHA: A Benchmark for Visual Language Models in Trustworthy Safety Hazard Assessment Scenarios

TSHA:用于可信安全危害评估场景的视觉语言模型基准

Qiucheng Yu, Ruijie Xu, Mingang Chen, Jianfeng Dong, Xin Tan

机构 * City University of Hong Kong(香港城市大学) East China Normal University(华东师范大学) University of Western Australia(西澳大学) Shanghai AI Laboratory(上海人工智能实验室) Shanghai Development Center of Computer Software Technology(上海计算机软件技术开发中心) Zhejiang Gongshang University(浙江工商大学)

专题命中 幻觉与鲁棒性 :visual language model(title);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出TSHA基准,通过81809个精心挑选的训练样本和1707个挑战性测试样本,评估视觉语言模型在复杂家庭安全场景中的鲁棒性和泛化能力,发现现有模型在安全危害评估中存在显著不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15892 2026-07-15 cs.CV cs.AI 版本更新 81%

Egocentric Bias in Vision-Language Models

视觉语言模型中的自我中心偏差

Maijunxian Wang, Yijiang Li, Bingyang Wang, Tianwei Zhao, Ran Ji, Qingying Gao, Emmy Liu, Hokin Deng, Dezhi Luo

机构 * Cognitive Science Program, University of California, Berkeley(加州大学伯克利分校认知科学项目) Department of Electrical and Computer Engineering, University of California San Diego(加州大学圣地亚哥分校电气与计算机工程系) School of Computer Science, Georgia Institute of Technology & Emory University(佐治亚理工学院计算机科学学院及埃默里大学) Department of Computer Science, Johns Hopkins University(约翰霍普金斯大学计算机科学系) Department of Cognitive Science, University of California San Diego(加州大学圣地亚哥分校认知科学系) Equal Advising Department of Computer Science & Wilmer Eye Institute, Johns Hopkins University(约翰霍普金斯大学计算机科学系及威尔默眼科研究所) Language Technologies Institute, Carnegie Mellon University(卡内基梅隆大学语言技术研究所) Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所) Weinberg Institute for Cognitive Science, University of Michigan(密歇根大学韦恩伯格认知科学研究所)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出FlipSet基准,揭示视觉语言模型在第二级视觉视角推理中存在系统性自我中心偏差,表明模型在整合社会认知与空间操作方面存在根本性不足。

Comments Accepted at CogSci 2026 (Best Undergraduate Student Paper)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09562 2026-07-13 cs.CV cs.AI 新提交 81%

TCLA: Training-Free Class-wise Logit Adaptation for Medical Vision-Language Models

TCLA:用于医学视觉语言模型的无训练类级对数几率适应

Tianyou Jiang, Ziyu Zhou

机构 * University of Bern(伯尔尼大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 针对医学视觉语言模型在分布外数据上有效性下降问题,提出无训练的少样本适应方法TCLA。该方法基于支持样本校正推理对数几率,提升模型性能,实验表明其能持续提高模型OOD性能且多数情况下优于现有训练方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09450 2026-07-13 cs.CV cs.LG 新提交 81%

Robustifying Vision-Language Models via Test-Time Prompt Adaptation

通过测试时提示自适应增强视觉语言模型的鲁棒性

Xingyu Zhu, Huanshen Wu, Shuo Wang, Beier Zhu, Jiannan Ge, Jiaheng Zhang, Long Chen

机构 * University of Science(科学大学) National University of Singapore(新加坡国立大学) The Hong Kong University of Science(香港科学大学)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.LG

AI总结 研究针对对抗扰动下视觉语言模型性能下降问题,提出RITA框架,通过最优传输实现分布级对齐,引入动态缓存积累线索,提升了模型对抗鲁棒性且不损干净准确率。

Comments ICML 2026 regular

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09349 2026-07-13 cs.CL cs.AI cs.LG 新提交 81%

Deceptive Grounding: Entity Attribution Failure in Clinical Retrieval-Augmented Generation

欺骗性基础:临床检索增强生成中的实体归因失败

Cedric Caruzzo, Donggeun Yoo, Tae Soo Kim

机构 * Lunit(鲁尼特)

专题命中 幻觉与鲁棒性 :grounding(title,abstract);分类 cs.AI、cs.LG

AI总结 研究临床检索增强生成中的欺骗性基础问题,通过对13个模型测试发现DG率8%-87%,医学等微调模型高达86.7%。控制消融确定机制,实体归因验证可检测DG,现有框架未实施,为该领域研究提供新视角和方法。

Comments 24 pages, 7 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07375 2026-07-09 cs.LG cs.AI 新提交 81%

On Adversarial Vulnerability of Vision-Language Models through the Lens of Intermediate Spectral Subspaces

基于中间谱子空间视角的视觉语言模型对抗脆弱性研究

Chethan Krishnamurthy Ramanaik, Tobias Callies, Michael Hecht, Eirini Ntoutsi

机构 * University of the Bundeswehr Munich(慕尼黑联邦国防军大学) University of Wrocław(弗罗茨瓦夫大学)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.AI、cs.LG

AI总结 研究基于Transformer的视觉语言模型对抗脆弱性,提出白盒谱子空间引导攻击(SSGRA),通过将中间表示与特定子空间对齐来攻击,实验显示其比现有基线更有效,还为模型对抗脆弱性提供谱解释,助力提升鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03365 2026-07-07 cs.CV cs.AI 新提交 81%

Brand-as-Memory: Vision-Language Models Encode Causal, Mechanistically Localizable Credibility Priors for News Sources

品牌即记忆:视觉语言模型为新闻来源编码因果性、可机制定位的可信度先验

Chih-Ting Liao, Xin Cao

机构 * University of New South Wales(新南威尔士大学)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 研究视觉语言模型中基于媒体身份的来源可信度先验,通过交叉模型基准测试和机制分析,揭示其特性及影响,如模型和规模依赖性、因果形成机制等。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02575 2026-07-07 cs.CV cs.AI 新提交 81%

Criterion-Conditional In-Context Learning: Evaluating Criterion-Shift Adaptation in Vision-Language Models

标准条件上下文学习:评估视觉语言模型中的标准转移适应性

Kaiyun Yang, Ruilin Yang, Zhimin Yao, J. Wang, Wei Ge

机构 * Megvii Technology Inc., Beijing, China(美科科技有限公司,北京,中国)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 研究提出标准条件上下文学习(CC-ICL)新设置,模型需从上下文推断潜在标准并据此调整预测。为此提出两个评估指标,构建CC-Bench基准。实验发现多数模型有边界偏差,简单多标准训练可改善。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16651 2026-06-11 cs.CV cs.LG 版本更新 81%

Right Predictions, Misleading Explanations: On the Vulnerability of Vision-Language Model Explanations

正确预测,误导性解释:关于视觉-语言模型解释的脆弱性

Narges Babadi, Hadis Karimipour

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.LG

AI总结 研究探讨了视觉-语言模型中解释热图在对抗条件下是否忠实反映推理过程,提出X-Shift攻击揭示解释与预测行为的脱节,验证了解释机制的脆弱性。

Comments Accepted at the ICML 2026 Workshop on Trustworthy AI for Good (AI4GOOD), Seoul, South Korea

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06943 2026-06-08 cs.CV cs.AI 新提交 81%

SS-TPT: Stability and Suitability-Guided Test-Time Prompt Tuning for Adversarially Robust Vision-Language Models

SS-TPT:面向对抗鲁棒视觉语言模型的稳定性和适用性引导的测试时提示微调

Sunoh Kim, Daeho Um

机构 * Dankook University, Yongin, South Korea(首尔大学,韩国永兴) University of Seoul, Seoul, South Korea(首尔大学,韩国首尔)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 提出SS-TPT方法,通过稳定性与适用性分数评估增强视图质量,引导测试时提示微调,在保持高吞吐量的同时显著提升对抗鲁棒性。

Comments Accepted in ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02947 2026-06-03 cs.LG cs.CV 81%

BYORn: Bootstrap Your Own Responses to Defend Large Vision-Language Models Against Backdoor Attacks

BYORn:自举你的响应以防御大型视觉-语言模型的后门攻击

Ivan Sabolić, Marin Oršić, Josip Šarić, Sven Lončarić

机构 * University of Rijeka(里耶卡大学)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.LG

AI总结 提出BYORn框架,通过识别并替换语义不合理的后门目标响应,打破触发器与目标输出的关联,从而在保持干净任务性能的同时提升对后门攻击的鲁棒性。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02111 2026-06-02 cs.CV cs.AI cs.CL 81%

Jailbreaking Multimodal Large Language Models using Multi-Clip Video

使用多片段视频破解多模态大语言模型

Choongwon Kang, Seungjong Sun, Hyunmin Jun, Jang Hyun Kim

机构 * Department of Applied Artificial Intelligence, Sungkyunkwan University(应用人工智能系,成均馆大学) Department of Human-Artificial Intelligence Interaction, Sungkyunkwan University(人机交互系,成均馆大学)

专题命中 幻觉与鲁棒性 :multimodal large language model(title,abstract);分类 cs.CV、cs.AI

AI总结 提出MCV SafetyBench数据集,通过多片段视频评估多模态大语言模型的安全漏洞,发现视频模态比图像更脆弱,动态和多样化上下文增加攻击成功率,并基于图像模态的鲁棒性提出防御策略。

Comments 27 pages, 20 figures, Accepted to the Main Conference of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26283 2026-05-27 cs.CV cs.LG 81%

Benchmarking Convolutional, Transformer, Hybrid, and Vision Language Models for Multi Disease Retinal Screening

卷积、Transformer、混合模型及视觉语言模型在多病种视网膜筛查中的基准测试

Durjoy Dey, Aymane Ajbar, Yuhong Yan

机构 * Department of Computer Science and Software Engineering(计算机科学与软件工程系) Concordia University(康科迪亚大学) Ebovir Biotechnologie Inc.(Ebovir生物技术公司)

专题命中 幻觉与鲁棒性 :vision language model(title);vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 本研究在RFMiD数据集上对四种模型家族的12种架构进行基准测试,评估其在多病种视网膜筛查中的性能,发现基于注意力的模型(如SwinTiny、CoAtNet0、MaxViTTiny)在二元筛查和多标签分类中表现最佳,视觉语言模型与CNN基线相当但未超越最优Transformer和混合模型。

Comments 12 pages, 3 figures, accepted at ICMHI 2026, 10th International Conference on Medical and Health Informatics, Kyoto, Japan. To appear in ACM Conference Proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19929 2026-05-20 cs.CV cs.AI 81%

Breaking Modality Heterogeneity in Low-Bit Quantization for Large Vision-Language Models

打破大视觉-语言模型低比特量化中的模态异质性

Yi Zhong, Haotong Qin, Xindong Zhang, Lei Zhang, Guolei Sun

机构 * VCIP, College of Computer Science, Nankai University(南开大学计算机科学学院VCIP) D-ITET, ETH Zürich(苏黎世联邦理工学院D-ITET) OPPO Research Institute(OPPO研究院) Department of Computing, Hong Kong Polytechnic University(香港理工大学计算机系)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出SplitQ框架,通过通道分割和自适应跨模态校准模块,解决大视觉-语言模型在低比特量化中因模态异质性导致的精度下降问题,显著提升了在多种多模态数据集上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15435 2026-05-20 cs.CV cs.AI cs.MA 81%

ORCA: An Agentic Reasoning Framework for Hallucination and Adversarial Robustness in Vision-Language Models

ORCA:一种用于视觉语言模型幻觉和对抗鲁棒性的代理推理框架

Chung-En Johnny Yu, Brian Jalaian, Nathaniel D. Bastian

机构 * University of West Florida(佛罗里达大学) United States Military Academy(美国军事学院)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出ORCA框架,通过推理时的结构化推理和小规模视觉模型,提升预训练视觉语言模型的事实准确性与对抗鲁棒性,并在幻觉基准和对抗扰动测试中取得显著提升。

Comments Accepted at the ACM International Conference on Cloud and Big Data Computing (ICCBDC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17826 2026-05-19 cs.CV cs.AI 81%

CounterCount: A Diagnostic Framework for Counting Bias in Vision Language Models

CounterCount: 一种用于视觉语言模型计数偏差诊断的框架

Reem Alzahrani, Hassan Alshanqiti, Bushra Bin Hemid, Zaid Alyafeai, Abdelrahman Eldesokey, Bernard Ghanem

机构 * KAUST(卡尔斯鲁德大学) University of Edinburgh(爱丁堡大学) King Abdullah University of Science and Technology(国王阿卜杜勒-阿齐兹大学)

专题命中 幻觉与鲁棒性 :vision language model(title);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出CounterCount框架,通过对比事实性与反事实性图像来诊断视觉语言模型在计数任务中的偏差问题,揭示模型对物体级先验知识的依赖,并提出统一的注意力调节策略提升反事实计数准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏