arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-09-17 至 2025-09-17 共收录 6 信号源:cs.CV, cs.AI, cs.LG

1. 幻觉与鲁棒性 6 篇

2509.12492 2025-09-17 cs.CV 85%

Evaluating Robustness of Vision-Language Models Under Noisy Conditions

Purushoth, Alireza

机构 * University of Nevada Reno(内华达大学拉斯维加斯分校)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);LLaVA(abstract);visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19579 2025-09-17 cs.RO cs.AI cs.CL cs.CV cs.LG 85%

Evaluating the Robustness of Open-Source Vision-Language Models to Domain Shift in Object Captioning

Federico Tavella, Amber Drinkwater, Angelo Cangelosi

机构 * Centre for Robotic Autonomy in Demanding and Long-lasting Environments(机器人自主性在恶劣和持久环境中的研究中心) Centre for Robotics and AI(机器人与人工智能中心) University of Manchester(曼彻斯特大学) Amentum Clean Energy Ltd(Amentum清洁能源有限公司)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12724 2025-09-17 cs.CV cs.AI 81%

Defense-to-Attack: Bypassing Weak Defenses Enables Stronger Jailbreaks in Vision-Language Models

Yunhan Zhao, Xiang Zheng, Xingjun Ma

机构 * Fudan University(复旦大学) City University of Hong Kong(香港城市大学)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.AI

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.15244 2025-09-17 cs.CV cs.AI 81%

Adversarial Prompt Distillation for Vision-Language Models

Lin Luo, Xin Wang, Bojia Zi, Shihao Zhao, Xingjun Ma, Yu-Gang Jiang

机构 * Shanghai Key Lab of Intell. Info. Processing, School of CS, Fudan University(上海智能信息处理实验室,计算机科学学院,复旦大学) The Chinese University of Hong Kong, Shatin, Hong Kong(香港中文大学,沙田,香港) The University of Hong Kong, Pokfulam, Hong Kong(香港大学,薄扶林,香港)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.AI

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12521 2025-09-17 cs.LG 70%

Phi: Preference Hijacking in Multi-modal Large Language Models at Inference Time

Yifan Lan, Yuanpu Cao, Weitong Zhang, Lu Lin, Jinghui Chen

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) The University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);MLLM(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13127 2025-09-17 cs.CL 50%

Empowering LLMs with Parameterized Skills for Adversarial Long-Horizon Planning

Sijia Cui, Shuai Xu, Aiyao He, Yanna Wang, Bo Xu

机构 * 1 Institute of Automation, Chinese Academy of Sciences, Beijing, China 2 School of Artificial Intelligence, University of Chinese Academy of Sciences, Beijing, China 3 Nanjing Artificial Intelligence Research of IA, Nanjing, China 4 University of Chinese Academy of Sciences,Nanjing, Nanjing, China 5 Nanjing University of Information Science \& Technology, Nanjing, China

专题命中 幻觉与鲁棒性 :grounding(abstract)

Comments Accepted to IJCNN 2025

详情

展开后加载摘要…

URL PDF HTML 收藏