arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-01-08 至 2026-01-08 共收录 4 信号源:cs.CV, cs.AI, cs.LG

1. 幻觉与鲁棒性 4 篇

2512.17394 2026-01-08 cs.CL cs.CV cs.CY 85%

Are Vision Language Models Cross-Cultural Theory of Mind Reasoners?

视觉语言模型是否是跨文化理论思维推理者?

Zabir Al Nazi, GM Shahariar, Md. Abrar Hossain, Wei Peng

专题命中 幻觉与鲁棒性 :vision language model(title);vision-language model(abstract);VLM(abstract);MLLM(abstract)

AI总结 本文提出CulturalToM-VQA基准测试集,评估视觉语言模型在跨文化理论思维推理中的表现,发现前沿模型在准确性上显著提升,但存在假信念推理和区域差异等局限,揭示模型的社会可取性偏差问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03500 2026-01-08 cs.CV cs.AI 81%

SDCD: Structure-Disrupted Contrastive Decoding for Mitigating Hallucinations in Large Vision-Language Models

SDCD: 结构破坏对比解码用于缓解大视觉-语言模型中的幻觉

Yuxuan Xia, Siheng Wang, Peng Li

机构 * University of California, Santa Barbara(加州大学圣巴巴拉分校)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 SDCD通过结构破坏对比解码缓解大视觉-语言模型中的幻觉问题,有效抑制纹理驱动偏见,提升多模态能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04163 2026-01-08 eess.IV cs.CV cs.LG 62%

Scanner-Induced Domain Shifts Undermine the Robustness of Pathology Foundation Models

扫描诱导的域偏移损害病理基础模型的鲁棒性

Erik Thiringer, Fredrik K. Gustafsson, Kajsa Ledesma Eriksson, Mattias Rantalainen

机构 * Department of Medical Epidemiology and Biostatistics, Karolinska Institutet(卡罗林斯卡研究所医学流行病学与生物统计学系) Department of Engineering Science, University of Oxford(牛津大学工程科学系)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 本文研究了扫描诱导的域偏移对病理基础模型鲁棒性的影响,发现现有模型在面对扫描设备变异性时存在显著偏差,需改进嵌入稳定性和校准以提升临床可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03594 2026-01-08 cs.CR 50%

Jailbreaking LLMs & VLMs: Mechanisms, Evaluation, and Unified Defense

突破大语言模型与视觉语言模型:机制、评估与统一防御

Zejian Chen, Chaozhuo Li, Chao Li, Xi Zhang, Litian Zhang, Yiming He

专题命中 幻觉与鲁棒性 :vision-language model(abstract)

AI总结 本文提出三维框架系统回顾大语言模型和视觉语言模型的突破攻击与防御机制,提出统一防御原则并讨论未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏