arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-01-23 至 2026-01-23 共收录 4 信号源:cs.CV, cs.AI, cs.LG

1. 幻觉与鲁棒性 4 篇

2601.01747 2026-01-23 cs.CR cs.AI cs.CV cs.LG 85%

Crafting Adversarial Inputs for Large Vision-Language Models Using Black-Box Optimization

为大型视觉-语言模型设计对抗输入使用黑盒优化

Jiwei Guan, Haibo Jin, Haohan Wang

机构 * School of Computing, Macquarie University(麦考瑞大学计算机学院) School of Information Sciences, University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校信息科学学院)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);LLaVA(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出了一种基于零阶优化的黑盒劫持攻击方法,针对大型视觉-语言模型实现高成功率的对抗性攻击,揭示了当前模型安全机制的不足。

Comments EACL

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15698 2026-01-23 cs.CV cs.AI 81%

Beyond Visual Safety: Jailbreaking Multimodal Large Language Models for Harmful Image Generation via Semantic-Agnostic Inputs

超越视觉安全:通过语义无关输入对多模态大语言模型进行有害图像生成的劫持

Mingyu Yu, Lana Liu, Zhehao Zhao, Wei Wang, Sujuan Qin

机构 * State Key Laboratory of Networking and Switching Technology, Beijing University of Posts and Telecommunications(网络与交换技术国家重点实验室,北京邮电大学) School of Cyberspace Security, Beijing University of Posts and Telecommunications(网络安全学院,北京邮电大学)

专题命中 幻觉与鲁棒性 :multimodal large language model(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出BVS框架,通过语义无关输入对多模态大语言模型进行有害图像生成的劫持,揭示其视觉安全边界的脆弱性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15549 2026-01-23 cs.CV cs.AI 73%

VIOLA: Towards Video In-Context Learning with Minimal Annotations

VIOLA:迈向最小标注的视频情境学习

Ryo Fujii, Hideo Saito, Ryo Hachiuma

机构 * Keio University(Keio大学) Keio AI Research Center(Keio人工智能研究中心) NVIDIA(NVIDIA公司)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 VIOLA通过结合最小专家监督和大量未标注数据,实现高效视频情境学习,显著提升低资源环境下的适应性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15745 2026-01-23 cs.CL 50%

Hallucination Mitigating for Medical Report Generation

缓解医疗报告生成中的幻觉

Ruoqing Zhao, Runze Xia, Piji Li

机构 * College of Artificial Intelligence, Nanjing University of Aeronautics and Astronautics(南京航空航天大学人工智能学院) MIIT Key Laboratory of Pattern Analysis and Machine Intelligence(信息产业部模式分析与机器智能重点实验室) The Key Laboratory of Brain-Machine Intelligence Technology, Ministry of Education(教育部脑机智能技术重点实验室)

专题命中 幻觉与鲁棒性 :vision language model(abstract)

AI总结 KERM框架通过知识检索、净化模块和细粒度奖励,有效缓解医疗报告生成中的幻觉问题,提升报告质量。

详情

展开后加载摘要…

URL PDF HTML 收藏