机构
*
Institute of Artificial Intelligence, Beihang University, Beijing, China(北京航空航天大学人工智能研究院)
;
Center for Frontier AI Research, A*STAR, Singapore(A*STAR前沿人工智能研究中心)
;
Institute of Computing Technology, Chinese Academy of Sciences, China(中国科学院计算技术研究所)
专题命中
幻觉与鲁棒性
:vision-language model(title);vision language model(abstract);分类 cs.CV
MMT-ARD: Multimodal Multi-Teacher Adversarial Distillation for Robust Vision-Language Models
MMT-ARD: 多模态多教师对抗蒸馏用于鲁棒视觉-语言模型
Yuqi Li, Junhao Dong, Chuanguang Yang, Shiping Wen, Piotr Koniusz, Tingwen Huang, Yingli Tian, Yew-Soon Ong
机构
*
The City University of New York, CUNY(纽约城市大学)
;
Nanyang Technological University(南洋理工大学)
;
Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)
;
University of Technology Sydney(悉尼技术大学)
;
Data61, CSIRO(CSIRO数据61研究所)
;
Shenzhen University of Advanced Technology(深圳先进技术大学)
Self-Calibrated Consistency can Fight Back for Adversarial Robustness in Vision-Language Models
Jiaxiang Liu, Jiawei Du, Xiao Liu, Prayag Tiwari, Mingkun Xu
机构
*
Guangdong Institute of Intelligence Science and Technology(广东智能科学与技术研究院)
;
Agency for Science, Technology and Research(科技研究局)
;
School of Information Technology(信息技术学院)
JaiLIP: Jailbreaking Vision-Language Models via Loss Guided Image Perturbation
Md Jueal Mia, M. Hadi Amini
机构
*
Knight Foundation School of Computing and Information Sciences (KFSCIS)(骑士基金会计算与信息科学学院)
;
Florida International University(佛罗里达国际大学)
;
Sustainability, Optimization, and Learning for InterDependent networks laboratory (solid lab)(可持续性、优化与互依赖网络学习实验室)
Contrast Sensitivity in Multimodal Large Language Models: A Psychophysics-Inspired Evaluation
Pablo Hernández-Cámara, Alexandra Gomez-Villa, Jose Manuel Jaén-Lorites, Jorge Vila-Tomás, Valero Laparra, Jesus Malo
机构
*
Image Processing Lab, Universitat de València, Spain(瓦伦西亚大学图像处理实验室)
;
Computer Vision Center, Spain(西班牙计算机视觉中心)
;
Universitat Autònoma de Barcelona, Spain(巴塞罗那自治大学)
;
Center for Biomaterials and Tissue Engineering, Universitat Politecnica de Valencia, Spain(瓦伦西亚理工大学生物材料与组织工程中心)
专题命中
幻觉与鲁棒性
:multimodal large language model(title,abstract);分类 cs.CV
Judge Before Answer: Can MLLM Discern the False Premise in Question?
Jidong Li, Lingyong Fang, Haodong Zhao, Sufeng Duan, Gongshen Liu
机构
*
School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院)
;
Inner Mongolia Research Institute, Shanghai Jiao Tong University(上海交通大学内蒙古研究院)
专题命中
幻觉与鲁棒性
:MLLM(title);multimodal large language model(abstract);分类 cs.AI
Mitigating Hallucination in Large Vision-Language Models through Aligning Attention Distribution to Information Flow
Jianfei Zhao, Feng Zhang, Xin Sun, Chong Feng
机构
*
School of Computer Science and Technology, Beijing Institute of Technology(计算机科学与技术学院,北京理工大学)
;
Zhongguancun Academy(中关村学院)
;
Southeast Academy of Information Technology, Beijing Institute of Technology(信息技术东南学院,北京理工大学)
Beyond Spurious Signals: Debiasing Multimodal Large Language Models via Counterfactual Inference and Adaptive Expert Routing
Zichen Wu, Hsiu-Yuan Huang, Yunfang Wu
机构
*
School of Computer Science, Peking University(北京大学计算机科学学院)
;
MOE Key Laboratory of Computational Linguistics, Peking University(北京大学教育部计算语言学重点实验室)
;
National Key Laboratory for Multimedia Information Processing, Peking University(北京大学国家多媒体信息处理重点实验室)
专题命中
幻觉与鲁棒性
:multimodal large language model(title,abstract);分类 cs.AI
Calibration-Aware Prompt Learning for Medical Vision-Language Models
Abhishek Basu, Fahad Shamshad, Ashshak Sharifdeen, Karthik Nandakumar, Muhammad Haris Khan
机构
*
Department of Computer Vision, Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(计算机视觉系,Mohamed bin Zayed人工智能大学)
;
Department of Computer Science and Engineering, Michigan State University (MSU)(计算机科学与工程系,密歇根州立大学)
Mitigating Hallucinations in Large Vision-Language Models by Self-Injecting Hallucinations
Yifan Lu, Ziqi Zhang, Chunfeng Yuan, Jun Gao, Congxuan Zhang, Xiaojuan Qi, Bing Li, Weiming Hu
机构
*
Beijing Key Laboratory of Super Intelligent Security of Multi-Modal Information, CASIA(北京多模态信息超级智能安全重点实验室,中国科学院自动化所)
;
State Key Laboratory of Multimodal Artificial Intelligence Systems, CASIA(多模态人工智能系统国家重点实验室,中国科学院自动化所)
;
School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)
;
Hello Group(Hello集团)
;
Nanchang Hangkong University(南昌航空大学)
;
The University of Hong Kong(香港大学)
;
School of Information Science and Technology, ShanghaiTech University(上海科技大学信息科学与技术学院)