arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-08-31 至 2026-08-31 共收录 6 信号源:cs.CV, cs.AI, cs.LG

1. 幻觉与鲁棒性 6 篇

2606.20419 2026-08-31 cs.CV 版本更新 90%

Spectral Query-Key Product Weight Steering for Training-Free VLM Hallucination Mitigation

谱查询-键乘积权重引导用于免训练VLM幻觉缓解

Karn Tiwari, Varnith Chordia, Prathosh A P

机构 * Indian Institute of Science, Bengaluru(印度科学理工学院,班加罗尔) Snap Research(Snap 研究院)

专题命中 幻觉与鲁棒性 :VLM(title,title_cn);vision-language model(abstract);分类 cs.CV

AI总结 提出QK乘积引导,一种无数据、免训练、零推理成本的权重编辑方法,通过抑制中间层主导奇异模式减少对象幻觉,在三个GQA基VLM上平均降低CHAIR$_s$ 4.0%。

Comments Published at the Workshop on Actionable Interpretability at COLM 2026, EMNLP Conference 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19212 2026-08-31 cs.CL cs.AI 版本更新 87%

Steering Multimodal Large Language Models Decoding for Context-Aware Safety

面向上下文感知安全的多模态大语言模型解码引导

Zheyuan Liu, Zhangchen Xu, Guangyao Dou, Xiangchi Yuan, Zhaoxuan Tan, Radha Poovendran, Meng Jiang

机构 * University of Notre Dame(notre dame 大学) University of Washington(华盛顿大学) Johns Hopkins University(约翰霍普金斯大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 幻觉与鲁棒性 :multimodal large language model(title,abstract);MLLM(abstract,abstract_cn);分类 cs.AI

AI总结 针对多模态大语言模型安全对齐的平衡难题,提出SafeCoDe解码框架,通过两阶段机制优化上下文敏感的弃权行为,在多基准实验中有效提升安全性能且保留模型有用性。

Comments EMNLP 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28058 2026-08-31 cs.CV cs.AI 新提交 81%

Dynamic Alignment Compensation for Hallucination Mitigation in Large Vision-Language Models

用于减轻大型视觉语言模型幻觉的动态对齐补偿

Kairong Yu, Zixin Zhu, Le Yu, Hongwei Wang

机构 * Zhejiang University(浙江大学) Southeast University(东南大学)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 针对大型视觉语言模型的幻觉问题,提出无需训练的推理时方法动态对齐补偿,结合分层语义补偿与序列语义校正,在9个多模态基准上可减少幻觉并保持整体性能。

Comments Accepted by EMNLP2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28145 2026-08-31 cs.CV 新提交 79%

Dual-Stream Semantic Guidance with Prototype Anchor Calibration for Source-Fully-Free Adaptation of Vision-Language Models

用于视觉语言模型无源域适应的带原型锚定校准的双流语义引导

Weiwei Xiang, Shun Peng, Guangyi Xiao, Hao Chen, Lei Yang

机构 * College of Computer Science and Electronic Engineering, Hunan University(湖南大学计算机与电子工程学院) Huaihua University(怀化学院)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV

AI总结 针对无源全自由域适应的双语义漂移问题,提出DSSG框架及带原型锚定校准的DSSG-PAC,在多基准上性能优于SOTA且适配时间降低18.9%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27502 2026-08-31 cs.SE cs.CV 新提交 70%

Image Augmentation as Test Generation for Deep Learning-Based Image Retrieval Systems

图像增强作为深度学习图像检索系统的测试生成方法

Yehan De Silva, Anirudh Sridhar, Armin Lotfy, Nafiseh Kahani, Yvan Labiche, Ziyu Wang, Frank Ouyang, Clare Carty, Azalia Shamsaei

专题命中 幻觉与鲁棒性 :LLaVA(abstract,abstract_cn);分类 cs.CV

AI总结 该研究将图像增强技术作为深度学习图像检索系统的测试生成方法,通过实证研究筛选出天气模拟和SaSPA等适配的增强技术,为构建有效测试套件提供了实用指南。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28394 2026-08-31 cs.CR cs.CL 新提交 50%

BEACON: Behavior-Anchored Cross-Source Knowledge Graph Construction for Cyber Threat Intelligence

BEACON:面向网络威胁情报的行为锚定跨源知识图谱构建

Changze Li, Yutong Cheng, Tsania Camila Finnisa, Qian Cui, Wei Ding, Peng Gao

专题命中 幻觉与鲁棒性 :grounding(abstract)

AI总结 该研究提出BEACON框架,基于LLM结合MITRE ATT&CK实现跨源CTI知识图谱构建,构建了两个标注数据集,性能优于基线方法至少9%至23%。

详情

展开后加载摘要…

URL PDF HTML 收藏