arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-01-12 至 2026-01-12 共收录 4 信号源:cs.CV, cs.AI, cs.LG

1. 幻觉与鲁棒性 4 篇

2601.05739 2026-01-12 cs.AI cs.CL cs.CR cs.CV 84%

PII-VisBench: Evaluating Personally Identifiable Information Safety in Vision Language Models Along a Continuum of Visibility

PII-VisBench: 在可见性连续体上评估视觉语言模型中个人可识别信息安全性

G M Shahariar, Zabir Al Nazi, Md Olid Hasan Bhuiyan, Zhouxing Shi

机构 * University of California, Riverside(加州大学河滨分校)

专题命中 幻觉与鲁棒性 :vision language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 PII-VisBench 评估视觉语言模型在可见性连续体上对个人可识别信息安全性的保护,通过4000个探测器分析不同可见性水平下的隐私泄露情况。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01042 2026-01-12 cs.CV cs.CR cs.LG 73%

Transferability of Adversarial Attacks in Video-based MLLMs: A Cross-modal Image-to-Video Approach

视频基于多模态大语言模型中的对抗攻击可迁移性:一种跨模态图像到视频的方法

Linhao Huang, Xue Jiang, Zhiqiang Wang, Wentao Mo, Xi Xiao, Yong-Jie Yin, Bo Han, Feng Zheng

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.LG

AI总结 本文提出了一种跨模态图像到视频的对抗攻击方法,用于研究视频多模态大语言模型的可迁移性,实验表明该方法在多个视频-文本多模态任务中表现出强对抗转移性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.05254 2026-01-12 cs.CV cs.AI cs.LG 67%

Explaining Low Perception Model Competency with High-Competency Counterfactuals

用高能力反事实解释低感知模型能力

Sara Pohland, Claire Tomlin

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出五种生成高能力反事实图像的方法,用于解释模型预测不确定性的原因,并通过实验验证了其在生成语言解释中的有效性。

Journal ref Explainable Artificial Intelligence. xAI 2025. Communications in Computer and Information Science, vol 2580

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14367 2026-01-12 cs.CV 57%

Hallucination Score: Towards Mitigating Hallucinations in Generative Image Super-Resolution

幻觉分数:朝着减轻生成图像超分辨率中的幻觉

Weiming Ren, Raghav Goyal, Zhiming Hu, Tristan Ty Aumentado-Armstrong, Iqbal Mohomed, Alex Levinshtein

机构 * University of Waterloo(多伦多大学) AI Center – Toronto, Samsung Electronics(三星电子人工智能中心)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出幻觉分数以衡量和减轻生成图像超分辨率中的幻觉问题,通过多模态大语言模型生成 HS 并用于模型微调。

Comments 31 pages, 21 figures, and 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏