Confidence Calibration for Multimodal LLMs: An Empirical Study through Medical VQA
多模态大语言模型的置信度校准:基于医学视觉问答的实证研究
Yuetian Du, Yucheng Wang, Ming Kong, Tian Liang, Qiang Long, Bingdi Chen, Qiang Zhu
机构
*
College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院)
;
School of Computer Science and Technology, Xidian University(西安电子科技大学计算机科学与技术学院)
;
Zhihui Medical Technology (Shanghai) Co., Ltd.(智汇医疗科技(上海)有限公司)
Hallucination Detection and Correction in Medical VLMs via Counter-Evidence Verification
基于反事实证据验证的医学视觉语言模型幻觉检测与纠正
Nan Zhou, Ke Zou, Meng Liu, Linchao He, Jiaqi Zhu, Yi Zhang, Hu Chen, Huazhu Fu
机构
*
College of Computer Science, Sichuan University(四川大学计算机科学学院)
;
Yong Loo Lin School of Medicine, National University of Singapore(新加坡国立大学杨潞龄医学院)
;
Key Laboratory of Data Protection and Intelligent Management, Ministry of Education, Sichuan University(四川大学数据保护与智能管理教育部重点实验室)
;
National Key Laboratory of Autonomous Intelligent Unmanned Systems, Beijing Institute of Technology(北京理工大学自主智能无人系统国家重点实验室)
;
Institute of High Performance Computing (IHPC), Agency for Science, Technology and Research (A*STAR)(新加坡科技研究局高性能计算研究所)
Artemis: Anatomy-Resolved inTervention for Eliminating Multimodal NeuroImage confounderS
Artemis: 解剖分辨的干预方法用于消除多模态神经影像混杂因素
Siyuan Dai, Yang Du, Kun Zhao, Zhusuyi Chen, Heng Huang, Paul Thompson, Chao Shi, Haoteng Tang, Liang Zhan
机构
*
University of Pittsburgh(匹兹堡大学)
;
University of Maryland(马里兰大学)
;
University of Southern California(南加州大学)
;
Binghamton University(宾汉姆顿大学)
;
University of Texas Rio Grande Valley(德克萨斯大学里奥格兰德河谷分校)
Modality-Aware Feature Matching in Visual and Vision-Language Applications: A Comprehensive Survey
视觉与视觉-语言应用中的模态感知特征匹配:全面综述
Weide Liu, Wei Zhou, Jun Liu, Ping Hu, Jun Cheng, Jungong Han, Weisi Lin
机构
*
School of Computing and Artificial Intelligence, Jiangxi University of Finance and Economics(江西财经大学计算机与人工智能学院)
;
College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算机与数据科学学院)
;
School of Computer Science and Informatics, Cardiff University(卡迪夫大学计算机科学与信息学院)
;
School of Computing and Communications, Lancaster University(兰卡斯特大学计算机与通讯学院)
;
School of Computer Science and Engineering, University of Electronic Science and Technology of China(电子科技大学计算机科学与工程学院)
;
Institute for Infocomm Research, Agency for Science, Technology and Research (A*STAR)(新加坡资讯研究院,科技研究局(A*STAR))
;
Department of Automation, Tsinghua University(清华大学自动化系)
机构
*
Department of Computer Science and Technology, Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)计算机科学与技术学院)
;
School of Intelligence Science and Engineering, College of Artificial Intelligence, Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)人工智能学院智能科学与工程学院)
;
School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院)
;
Guangdong Key Laboratory of Biomedical Measurements and Ultrasound Imaging, School of Biomedical Engineering, Shenzhen University Medical School, Shenzhen University(深圳大学医学部生物医学工程学院广东省生物医学测量与超声成像重点实验室)
;
Department of Radiology, The People’s Hospital of Guangxi Zhuang Autonomous Region, Guangxi Academy of Medical Sciences(广西壮族自治区人民医院放射科,广西医学科学院)
;
Shenzhen Sixth People’s Hospital (Nanshan Hospital), Huazhong University of Science and Technology Union Shenzhen Hospital(华中科技大学协和深圳医院(深圳市第六人民医院))
;
School of Basic Medical Sciences, Shenzhen University(深圳大学基础医学院)
;
Egypt-Japan University of Science and Technology (E-JUST)(埃及日本科技大学)
;
School of Biomedical Engineering, National-Regional Key Technology Engineering Laboratory for Medical Ultrasound, Guangdong Key Laboratory for Biomedical Measurements and Ultrasound Imaging, Shenzhen University Medical School(深圳大学医学部生物医学工程学院,国家地方联合医学超声关键技术工程实验室,广东省生物医学测量与超声成像重点实验室)
MM-Snowball: Evaluating and Mitigating Hallucination Snowballing in Multimodal Multi-Turn Dialogue
MM-Snowball:多模态多轮对话中的幻觉雪崩评估与缓解
Yue Jiang, Xue Jiang, Lihua Zhang, Zhiqiang Wang, Yuhang Lu, Peng Wang, Bo Han, Feng Zheng, Dingkang Yang
机构
*
College of Intelligent Robotics and Advanced Manufacturing, Fudan University(复旦大学智能机器人与先进制造学院)
;
Southern University of Science and Technology(南方科技大学)
;
TMLR Group, Hong Kong Baptist University(香港 Baptist 大学 TMLR 团体)
;
MM Lab, CUHK(CUHK 多模态实验室)
;
RAMS Lab, Huawei Technologies Co., Ltd.(华为技术有限公司 RAMS 实验室)
机构
*
The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
;
Lingnan University(岭南大学)
;
The Third Affiliated Hospital of Kunming Medical University, Yunnan Cancer Hospital, Peking University Cancer Hospital Yunnan(昆明医科大学第三附属医院、云南癌症医院、北京大学肿瘤医院云南分院)
;
Guangzhou First People's Hospital, South China University of Technology(广州第一人民医院、华南理工大学)
;
The Third Affiliated Hospital, Sun Yat-Sen University(中山大学第三附属医院)
;
HKUST Shenzhen-Hong Kong Collaborative Innovation Research Institute(香港科技大学深圳-香港协同创新研究院)
UniMedVL: Unifying Medical Multimodal Understanding and Generation through Observation-Knowledge-Analysis
UniMedVL: 通过观察-知识-分析统一医学多模态理解与生成
Junzhi Ning, Wei Li, Cheng Tang, Jiashi Lin, Chenglong Ma, Chaoyang Zhang, Jiyao Liu, Ying Chen, Shujian Gao, Yuandong Pu, Huihui Xu, Chenhui Gou, Ziyan Huang, Yi Xin, Qi Qin, Diping Song, Bin Fu, Guang Yang, Yuanfeng Ji, Tianbin Li, Yanzhou Su, Jin Ye, Shixiang Tang, Zhongying Deng, Lihao Liu, Ming Hu, Junjun He
机构
*
Shanghai Artificial Intelligence Laboratory
;
Shanghai Innovation Institute
;
Shanghai Jiao Tong University
;
Shanghai Institute of Optics
;
Fudan University
;
University of Cambridge
;
Monash University
;
DAMO Academy, Alibaba Group
;
Imperial College London
;
The University of Hong Kong
;
The Hong Kong University of Science
;
Hupan Lab
;
The Chinese University of Hong Kong
机构
*
Arizona State University(亚利桑那州立大学)
;
Clemson University(克莱姆森大学)
;
Washington University in St. Louis(圣路易斯华盛顿大学)
;
University of Notre Dame(诺特丹大学)
;
Florida State University(佛罗里达州立大学)
;
Rice University(里德大学)
;
NVIDIA(英伟达)
;
Mayo Clinic(梅奥诊所)
A Multimodal Framework for Dementia Detection via Linguistic and Acoustic Representation Learning
基于语言和声学表征学习的多模态痴呆检测框架
Loukas Ilias, Dimitris Askounis
机构
*
Decision Support Systems Laboratory, School of Electrical and Computer Engineering, National Technical University of Athens(决策支持系统实验室,电气与计算机工程学院,国家技术大学雅典)
机构
*
Department of Data Science \& AI, Faculty of Information Technology, Monash University, Melbourne, VIC 3800, Australia Alfred Health Radiology, Alfred Health, Melbourne, VIC 3004, Australia School of Translational Medicine, Faculty of Medicine, Nursing
;
Health Sciences, Monash University, Melbourne, VIC 3800, Australia Hong Kong Polytechnic University, Hong Kong SAR, China
CommentsEarly accepted by MICCAI 2026. This version of the contribution has been accepted for publication, after peer review (when applicable) but is not the Version of Record and does not reflect post-acceptance improvements, or any corrections
Universal Boosts, Specific Suppressors: Sparse Autoencoder Steering of Medical Vision-Language Models
通用增强,特定抑制:基于稀疏自编码器引导的医学视觉语言模型
Farhad Nooralahzadeh, Benjamin Gundersen, Nicolas Deperrois, Hidetoshi Matsuom, Mizuho Nishio, Thomas Frauenfelder, Ahmed Allam, Christian Blüthgen, Michael Moor, Michael Krauthammer
机构
*
University of Zurich and University Hospital of Zurich(苏黎世大学及苏黎世大学医院)
;
Kobe University(Kobe大学)
;
ETH AI Center(苏黎世联邦理工学院人工智能中心)
;
ETH Zurich(苏黎世联邦理工学院)
;
Stanford University(斯坦福大学)
;
Zurich University of Applied Sciences(苏黎世应用科学大学)
机构
*
School of Computer Science and Engineering, Central South University(中南大学计算机科学与工程学院)
;
Department of Data Science and Artificial Intelligence, The Hong Kong Polytechnic University(香港理工大学数据科学与人工智能系)
;
School of Information and Communication Technology, Griffith University(格里菲斯大学信息与通信技术学院)
机构
*
Computer Aided Medical Procedures (CAMP)(计算机辅助医疗程序)
;
TU Munich, Germany(慕尼黑工业大学,德国)
;
Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心)
;
Munich, Germany(慕尼黑,德国)
;
Zhongshan Hospital, Fudan University, China(复旦大学中山医院)
;
The University of Hong Kong, Hongkong, China(香港大学,香港,中国)
MedFM-Robust: Benchmarking Robustness of Medical Foundation Models
MedFM-Robust:医学基础模型的鲁棒性基准测试
Xiangxiang Cui, Tianjin Huang, Yifang Wang, Lijie Hu, Lu Yin
机构
*
Beijing Normal University, China(北京师范大学)
;
University of Exeter, United Kingdom(埃克塞特大学)
;
University College London, United Kingdom(伦敦大学学院)
;
Mohamed bin Zayed University of Artificial Intelligence, United Arab Emirates(穆罕默德·本·扎耶德人工智能大学)
;
University of Surrey, United Kingdom(萨里大学)
Towards Clinically Interpretable Ophthalmic VQA via Spatially-Grounded Lesion Evidence
迈向具有空间定位病变证据的临床可解释性眼科VQA
Xingyue Wang, Bo Liu, Meng Wang, Zhixuan Zhang, Chengcheng Zhu, Huazhu Fu, Jiang Liu
机构
*
Department of Computer Science and Engineering, Southern University of Science and Technology(南方科技大学计算机科学与工程系)
;
The Hong Kong Polytechnic University(香港理工大学)
;
National University of Singapore(新加坡国立大学)
;
University of Washington(华盛顿大学)
;
Institute of High Performance Computing, Agency for Science, Technology and Research(科技研究局高性能计算研究所)
RoiMAM: Region-of-Interest Medical Attention Model for Efficient Vision-Language Understanding
RoiMAM:面向高效视觉-语言理解的感兴趣区域医学注意模型
Jiayan Yang, Zhuoyu Wu, Wenqi Fang
机构
*
Shenzhen Institutes of Advanced Technology, Chinese Academy of Science(深圳先进技术研究院,中国科学院)
;
CyPhi( ) AI Research Lab, School of IT, Monash University, Malaysia Campus(CyPhi人工智能研究实验室,信息学院,墨尔本大学马来西亚校区)
CapCLIP: A Vision-Language Representation Alignment Approach for Wireless Capsule Endoscopy Analysis
CapCLIP:一种用于无线胶囊内镜分析的视觉-语言表示对齐方法
Haroon Wahab, Irfan Mehmood, Hassan Ugail
机构
*
School of Computer Science, AI and Electronics Faculty of Engineering and Digital Technologies(计算机科学与电子工程学院,工程与数字技术学院)
;
School of Management Faculty of Mgmt, Law & Social Sciences(管理学院,管理、法律与社会科学学院)
;
Centre for Visual Computing and Intelligent Systems(视觉计算与智能系统中心)