arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 2260 信号源:cs.CV, cs.AI, cs.LG

1. 幻觉与鲁棒性 2260 篇

2505.20901 2025-05-28 cs.CL cs.AI 79%

A Stereotype Content Analysis on Color-related Social Bias in Large Vision Language Models

Junhyuk Choi, Minju Kim, Yeseon Hong, Bugeun Kim

机构 * Department of Artificial Intelligence, Chung-Ang University(人工智能系, Chung-Ang 大学)

专题命中 幻觉与鲁棒性 :vision language model(title,abstract);分类 cs.AI

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20362 2025-05-28 cs.IR cs.AI 79%

VSCBench: Bridging the Gap in Vision-Language Model Safety Calibration

Jiahui Geng, Qing Li, Zongxiong Chen, Yuxia Wang, Derui Zhu, Zhuohan Xie, Chenyang Lyu, Xiuying Chen, Preslav Nakov, Fakhri Karray

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎德·本·扎耶德人工智能大学) Fraunhofer Institute for Open Communication Systems(弗劳恩霍夫开放通信系统研究所) Technical University of Munich(慕尼黑技术大学) Alibaba International Digital Commerce(阿里巴巴国际数字商务)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15425 2025-05-26 cs.CV 79%

On the Robustness of Medical Vision-Language Models: Are they Truly Generalizable?

Raza Imam, Rufael Marew, Mohammad Yaqub

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎德·穆萨大学人工智能学院)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV

Comments Dataset and Code is available at https://github.com/BioMedIA-MBZUAI/RobustMedCLIP Accepted at: Medical Image Understanding and Analysis (MIUA) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11405 2025-05-19 cs.CV cs.CL 79%

EmotionHallucer: Evaluating Emotion Hallucinations in Multimodal Large Language Models

Bohao Xing, Xin Liu, Guoying Zhao, Chengyu Liu, Xiaolan Fu, Heikki Kälviäinen

机构 * Lappeenranta-Lahti University of Technology LUT(拉佩兰塔-拉赫蒂技术大学) University of Oulu(奥卢大学) Southeast University(东南大学) Shanghai Jiao Tong University(上海交通大学) Brno University of Technology(布拉格技术大学)

专题命中 幻觉与鲁棒性 :multimodal large language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.05046 2025-05-07 cs.CV cs.CL 79%

FGAIF: Aligning Large Vision-Language Models with Fine-grained AI Feedback

Liqiang Jing, Xinya Du

机构 * Department of Computer Science, The University of Texas at Dallas(计算机科学系,德克萨斯大学达拉斯分校)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02971 2025-05-07 cs.CV 79%

Adversarial Robustness Analysis of Vision-Language Models in Medical Image Segmentation

Anjila Budathoki, Manish Dhakal

机构 * Department of Computer Science(计算机科学系) Georgia State University(佐治亚州立大学)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.01851 2025-05-06 cs.CV 79%

Mitigating Group-Level Fairness Disparities in Federated Visual Language Models

Chaomeng Chen, Zitong Yu, Junhao Dong, Sen Su, Linlin Shen, Shutao Xia, Xiaochun Cao

机构 * Great Bay University(大湾大学) Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院) Nanyang Technological University(南洋理工大学) Beijing University of Posts and Telecommunications(北京邮电大学) Shenzhen University(深圳大学) Pengcheng Laboratory(鹏城实验室) Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区)

专题命中 幻觉与鲁棒性 :visual language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10179 2025-04-15 cs.AI cs.CL cs.ET 79%

The Future of MLLM Prompting is Adaptive: A Comprehensive Experimental Evaluation of Prompt Engineering Methods for Robust Multimodal Performance

Anwesha Mohanty, Venkatesh Balavadhani Parthasarathy, Arsalan Shahid

专题命中 幻觉与鲁棒性 :MLLM(title);multimodal large language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01838 2025-04-03 cs.CV 79%

Prompting Medical Vision-Language Models to Mitigate Diagnosis Bias by Generating Realistic Dermoscopic Images

Nusrat Munia, Abdullah-Al-Zubaer Imran

专题命中 幻觉与鲁棒性 :vision-language model(title);vision language model(abstract);分类 cs.CV

Comments Paper accepted at International Symposium on Biomedical Imaging (ISBI 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.16724 2025-04-02 cs.CV 79%

Devils in Middle Layers of Large Vision-Language Models: Interpreting, Detecting and Mitigating Object Hallucinations via Attention Lens

Zhangqi Jiang, Junkai Chen, Beier Zhu, Tingjin Luo, Yankun Shen, Xu Yang

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.15356 2025-04-02 cs.CV 79%

Alleviating Hallucinations in Large Vision-Language Models through Hallucination-Induced Optimization

Xinyu Lyu, Beitao Chen, Lianli Gao, Jingkuan Song, Heng Tao Shen

专题命中 幻觉与鲁棒性 :vision-language model(title);visual language model(abstract);分类 cs.CV

Comments Accepted by NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18334 2025-04-01 cs.CV 79%

Mitigating Cache Noise in Test-Time Adaptation for Large Vision-Language Models

Haotian Zhai, Xinyu Chen, Can Zhang, Tianming Sha, Ruirui Li

专题命中 幻觉与鲁棒性 :vision-language model(title);visual language model(abstract);分类 cs.CV

Comments Accepted by ICME 2025 and ICLR 2025 Workshop on Foundation Models in the Wild

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.12206 2025-03-27 cs.CV cs.CL 79%

PAINT: Paying Attention to INformed Tokens to Mitigate Hallucination in Large Vision-Language Model

Kazi Hasan Ibn Arif, Sajib Acharjee Dip, Khizar Hussain, Lang Zhang, Chris Thomas

专题命中 幻觉与鲁棒性 :vision-language model(title);vision language model(abstract);分类 cs.CV

Comments 6 pages, 4 tables, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17928 2025-03-25 cs.CV cs.CL 79%

Debiasing Multimodal Large Language Models via Noise-Aware Preference Optimization

Zefeng Zhang, Hengzhu Tang, Jiawei Sheng, Zhenyu Zhang, Yiming Ren, Zhenyang Li, Dawei Yin, Duohe Ma, Tingwen Liu

专题命中 幻觉与鲁棒性 :multimodal large language model(title,abstract);分类 cs.CV

Comments CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17489 2025-03-25 cs.CL cs.CV 79%

Judge Anything: MLLM as a Judge Across Any Modality

Shu Pu, Yaochen Wang, Dongping Chen, Yuhang Chen, Guohao Wang, Qi Qin, Zhongyi Zhang, Zhiyuan Zhang, Zetong Zhou, Shuang Gong, Yi Gui, Yao Wan, Philip S. Yu

专题命中 幻觉与鲁棒性 :MLLM(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10661 2025-03-25 cs.CV 79%

CeTAD: Towards Certified Toxicity-Aware Distance in Vision Language Models

Xiangyu Yin, Jiaxu Liu, Zhen Chen, Jinwei Hu, Yi Dong, Xiaowei Huang, Wenjie Ruan

专题命中 幻觉与鲁棒性 :vision language model(title);vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09668 2025-03-21 cs.CV 79%

Vision-Language Models Generate More Homogeneous Stories for Phenotypically Black Individuals

Messi H. J. Lee, Soyeon Jeon

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13962 2025-03-19 cs.CV 79%

Survey of Adversarial Robustness in Multimodal Large Language Models

Chengze Jiang, Zhuangzhuang Wang, Minjing Dong, Jie Gui

专题命中 幻觉与鲁棒性 :multimodal large language model(title,abstract);分类 cs.CV

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13792 2025-03-19 cs.CV 79%

Identifying and Mitigating Position Bias of Multi-image Vision-Language Models

Xinyu Tian, Shu Zou, Zhaoyuan Yang, Jing Zhang

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV

Comments Accepted to CVPR2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12874 2025-03-19 cs.CV 79%

Evolution-based Region Adversarial Prompt Learning for Robustness Enhancement in Vision-Language Models

Xiaojun Jia, Sensen Gao, Simeng Qin, Ke Ma, Xinfeng Li, Yihao Huang, Wei Dong, Yang Liu, Xiaochun Cao

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12096 2025-03-18 cs.CV 79%

O-TPT: Orthogonality Constraints for Calibrating Test-time Prompt Tuning in Vision-Language Models

Ashshak Sharifdeen, Muhammad Akhtar Munir, Sanoojan Baliah, Salman Khan, Muhammad Haris Khan

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV

Comments Accepted at CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.15839 2025-03-18 cs.CV 79%

VaLiD: Mitigating the Hallucination of Large Vision Language Models by Visual Layer Fusion Contrastive Decoding

Jiaqi Wang, Yifei Gao, Jitao Sang

专题命中 幻觉与鲁棒性 :vision language model(title);vision-language model(abstract);分类 cs.CV

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.15432 2025-03-17 cs.CL cs.CV 79%

Lifelong Knowledge Editing for Vision Language Models with Low-Rank Mixture-of-Experts

Qizhou Chen, Chengyu Wang, Dakan Wang, Taolin Zhang, Wangyue Li, Xiaofeng He

专题命中 幻觉与鲁棒性 :vision language model(title,abstract);分类 cs.CV

Comments CVPR 2025 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08229 2025-03-13 cs.CV 79%

Modeling Variants of Prompts for Vision-Language Models

Ao Li, Zongfang Liu, Xinhua Li, Jinghui Zhang, Pengwei Wang, Hu Wang

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08368 2025-03-12 cs.CV 79%

Debiased Prompt Tuning in Vision-Language Model without Annotations

Chaoquan Jiang, Yunfan Yang, Rui Hu, Jitao Sang

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16361 2025-02-26 cs.CY cs.CL cs.CV 79%

A Framework for Evaluating Vision-Language Model Safety: Building Trust in AI for Public Sector Applications

Maisha Binte Rashid, Pablo Rivas

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV

Comments AAAI 2025 Workshop on AI for Social Impact: Bridging Innovations in Finance, Social Media, and Crime Prevention

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15389 2025-02-24 cs.CV 79%

The Role of Background Information in Reducing Object Hallucination in Vision-Language Models: Insights from Cutoff API Prompting

Masayo Tomita, Katsuhiko Hayashi, Tomoyuki Kaneko

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15040 2025-02-24 cs.CL cs.AI 79%

Reducing Hallucinations of Medical Multimodal Large Language Models with Visual Retrieval-Augmented Generation

Yun-Wei Chu, Kai Zhang, Christopher Malon, Martin Renqiang Min

专题命中 幻觉与鲁棒性 :multimodal large language model(title,abstract);分类 cs.AI

Comments GenAI4Health - AAAI '25

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14881 2025-02-24 cs.CR cs.CV 79%

A Survey of Safety on Large Vision-Language Models: Attacks, Defenses and Evaluations

Mang Ye, Xuankun Rong, Wenke Huang, Bo Du, Nenghai Yu, Dacheng Tao

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV

Comments 22 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.03429 2025-02-06 cs.CL cs.AI 79%

On Fairness of Unified Multimodal Large Language Model for Image Generation

Ming Liu, Hao Chen, Jindong Wang, Liwen Wang, Bhiksha Raj Ramakrishnan, Wensheng Zhang

专题命中 幻觉与鲁棒性 :multimodal large language model(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏