arXivDaily arXiv每日学术速递 周一至周五更新

科学与医疗

医学 AI

医学智能、临床 AI、医学影像、病理、诊断和医疗健康大模型。

共收录 975 信号源:cs.CV, cs.LG, q-bio, eess.IV, eess.SP

1. 医疗多模态 975 篇

2606.19950 2026-06-19 cs.CV cs.AI 新提交 57%

Confidence Calibration for Multimodal LLMs: An Empirical Study through Medical VQA

多模态大语言模型的置信度校准:基于医学视觉问答的实证研究

Yuetian Du, Yucheng Wang, Ming Kong, Tian Liang, Qiang Long, Bingdi Chen, Qiang Zhu

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) School of Computer Science and Technology, Xidian University(西安电子科技大学计算机科学与技术学院) Zhihui Medical Technology (Shanghai) Co., Ltd.(智汇医疗科技(上海)有限公司)

专题命中 医疗多模态 :diagnosis(abstract);分类 cs.CV

AI总结 针对多模态大语言模型在医学任务中置信度与准确性不匹配的问题,提出结合多策略融合询问与专家大语言模型评估的方法,在三个医学VQA数据集上将期望校准误差平均降低40%,提升了模型可靠性。

Comments Accepted by MICCAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18609 2026-06-18 cs.CV 新提交 57%

Hallucination Detection and Correction in Medical VLMs via Counter-Evidence Verification

基于反事实证据验证的医学视觉语言模型幻觉检测与纠正

Nan Zhou, Ke Zou, Meng Liu, Linchao He, Jiaqi Zhu, Yi Zhang, Hu Chen, Huazhu Fu

机构 * College of Computer Science, Sichuan University(四川大学计算机科学学院) Yong Loo Lin School of Medicine, National University of Singapore(新加坡国立大学杨潞龄医学院) Key Laboratory of Data Protection and Intelligent Management, Ministry of Education, Sichuan University(四川大学数据保护与智能管理教育部重点实验室) National Key Laboratory of Autonomous Intelligent Unmanned Systems, Beijing Institute of Technology(北京理工大学自主智能无人系统国家重点实验室) Institute of High Performance Computing (IHPC), Agency for Science, Technology and Research (A*STAR)(新加坡科技研究局高性能计算研究所)

专题命中 医疗多模态 :diagnosis(abstract);分类 cs.CV

AI总结 提出CoEV框架,通过文本与视觉证据的双向验证检测并纠正医学VLM幻觉,无需重新训练,在四个数据集上显著提升检测和纠正性能。

Comments MICCAI 2026 Accept. Submission Version

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18287 2026-06-18 cs.LG 新提交 57%

Artemis: Anatomy-Resolved inTervention for Eliminating Multimodal NeuroImage confounderS

Artemis: 解剖分辨的干预方法用于消除多模态神经影像混杂因素

Siyuan Dai, Yang Du, Kun Zhao, Zhusuyi Chen, Heng Huang, Paul Thompson, Chao Shi, Haoteng Tang, Liang Zhan

机构 * University of Pittsburgh(匹兹堡大学) University of Maryland(马里兰大学) University of Southern California(南加州大学) Binghamton University(宾汉姆顿大学) University of Texas Rio Grande Valley(德克萨斯大学里奥格兰德河谷分校)

专题命中 医疗多模态 :diagnosis(abstract);分类 cs.LG

AI总结 提出Artemis框架,通过区域级因果干预学习特定脑区的混杂因素表示,消除fMRI和DTI多模态神经影像中人口统计学混杂因素对GNN的影响,在三个基准上提升性能。

Comments 11 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22791 2026-06-12 cs.CV 版本更新 57%

Modality-Aware Feature Matching in Visual and Vision-Language Applications: A Comprehensive Survey

视觉与视觉-语言应用中的模态感知特征匹配:全面综述

Weide Liu, Wei Zhou, Jun Liu, Ping Hu, Jun Cheng, Jungong Han, Weisi Lin

机构 * School of Computing and Artificial Intelligence, Jiangxi University of Finance and Economics(江西财经大学计算机与人工智能学院) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算机与数据科学学院) School of Computer Science and Informatics, Cardiff University(卡迪夫大学计算机科学与信息学院) School of Computing and Communications, Lancaster University(兰卡斯特大学计算机与通讯学院) School of Computer Science and Engineering, University of Electronic Science and Technology of China(电子科技大学计算机科学与工程学院) Institute for Infocomm Research, Agency for Science, Technology and Research (A*STAR)(新加坡资讯研究院,科技研究局(A*STAR)) Department of Automation, Tsinghua University(清华大学自动化系)

专题命中 医疗多模态 :medical image(abstract);分类 cs.CV

AI总结 综述基于模态的特征匹配,涵盖传统手工方法和现代深度学习方法,重点讨论跨RGB、深度、3D点云、LiDAR、医学图像及视觉-语言模态的进展,突出模态感知技术。

Comments CSUR

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11740 2026-06-11 cs.CV cs.CL 新提交 57%

UniReason-Med: A Shared Grounded Reasoning Interface for 2D-to-3D Transfer in Medical VQA

UniReason-Med: 用于医学VQA中二维到三维迁移的共享基础推理接口

Mengzhuo Chen, Yan Shu, Chi Liu, Hongming Piao, Xidong Wang, Derek Li, Bryan Dai

机构 * IQuest Research

专题命中 医疗多模态 :medical image(abstract);分类 cs.CV

AI总结 提出UniReason-Med框架,通过共享基础推理接口从2D医学图像向3D医学VQA迁移推理能力,结合监督微调和强化学习,显著提升3D推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11266 2026-06-11 cs.LG 新提交 57%

Seeing Before Colliding: Anticipatory Safe RL with Frozen Vision-Language Models

碰撞前的预见:利用冻结视觉-语言模型的预期性安全强化学习

Samuel Tetteh, Cody Fleming

机构 * Iowa State University(爱荷华州立大学)

专题命中 医疗多模态 :pathology(abstract);分类 cs.LG

AI总结 提出VLM-Safe-RL框架,通过冻结视觉-语言模型生成预期性成本项,改进CMDP拉格朗日更新,在高速碰撞场景下实现安全与回报的平衡。

Comments 44pages, 26 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07635 2026-06-09 cs.CV cs.AI 新提交 57%

NeuroAlign: Hierarchical Multimodal Fusion of Dynamic and Structural Neuroimaging for MCI Analysis

NeuroAlign: 用于MCI分析的动态与结构性神经影像的分层多模态融合

Xiongri Shen, Zhenxi Song, Jiaqi wang, Yi Zhong, Leilei Zhao, Chenqi Xu, Linling Li, Yichen Wei, Lingyan Liang, Demao Deng, Luping Song, Ping Luan, Ahmed M. Anter, Shuqiang Wang, Baiying Lei, Zhiguo Zhang

机构 * Department of Computer Science and Technology, Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)计算机科学与技术学院) School of Intelligence Science and Engineering, College of Artificial Intelligence, Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)人工智能学院智能科学与工程学院) School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院) Guangdong Key Laboratory of Biomedical Measurements and Ultrasound Imaging, School of Biomedical Engineering, Shenzhen University Medical School, Shenzhen University(深圳大学医学部生物医学工程学院广东省生物医学测量与超声成像重点实验室) Department of Radiology, The People’s Hospital of Guangxi Zhuang Autonomous Region, Guangxi Academy of Medical Sciences(广西壮族自治区人民医院放射科,广西医学科学院) Shenzhen Sixth People’s Hospital (Nanshan Hospital), Huazhong University of Science and Technology Union Shenzhen Hospital(华中科技大学协和深圳医院(深圳市第六人民医院)) School of Basic Medical Sciences, Shenzhen University(深圳大学基础医学院) Egypt-Japan University of Science and Technology (E-JUST)(埃及日本科技大学) School of Biomedical Engineering, National-Regional Key Technology Engineering Laboratory for Medical Ultrasound, Guangdong Key Laboratory for Biomedical Measurements and Ultrasound Imaging, Shenzhen University Medical School(深圳大学医学部生物医学工程学院,国家地方联合医学超声关键技术工程实验室,广东省生物医学测量与超声成像重点实验室)

专题命中 医疗多模态 :MRI(abstract);分类 cs.CV

AI总结 提出NeuroAlign框架,通过双模态分层对齐和双域分层交互融合fMRI与DTI特征,实现MCI/SCD检测,并设计无梯度归因方法SAM进行特征分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06760 2026-06-08 cs.CV 新提交 57%

MedSIGHT: Towards Grounded Visual Comprehension in Medical Large Vision-Language Models

MedSIGHT:迈向医学大型视觉语言模型中的基础视觉理解

Aofei Chang, Le Huang, Alex James Boyd, Parminder Bhatia, Taha Kass-Hout, Fenglong Ma, Cao Xiao

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 医疗多模态 :medical image(abstract);分类 cs.CV

AI总结 提出MedSIGHT框架,通过区域感知器、医学区域码本和渐进训练策略,统一医学视觉语言模型的语义理解和像素级分割,在72K数据上达到多模态理解与分割的SOTA。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05535 2026-06-05 cs.CV cs.AI 57%

Noise-Aware Visual Representation Learning for Medical Visual Question Answering

面向医学视觉问答的噪声感知视觉表示学习

I Putu Adi Pratama, Bahadorreza Ofoghi, Atul Sajjanhar, Shang Gao

机构 * Deakin University(德克萨斯大学)

专题命中 医疗多模态 :medical image(abstract);分类 cs.CV

AI总结 提出一种噪声感知的医学视觉问答框架,通过去噪自编码器学习鲁棒的视觉表示,并利用低秩适配高效微调,在SLAKE和PathVQA基准上提升了抗噪性和性能。

Comments 15 pages, 2 figures. Conference submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00622 2026-06-02 cs.CV 57%

MM-Snowball: Evaluating and Mitigating Hallucination Snowballing in Multimodal Multi-Turn Dialogue

MM-Snowball:多模态多轮对话中的幻觉雪崩评估与缓解

Yue Jiang, Xue Jiang, Lihua Zhang, Zhiqiang Wang, Yuhang Lu, Peng Wang, Bo Han, Feng Zheng, Dingkang Yang

机构 * College of Intelligent Robotics and Advanced Manufacturing, Fudan University(复旦大学智能机器人与先进制造学院) Southern University of Science and Technology(南方科技大学) TMLR Group, Hong Kong Baptist University(香港 Baptist 大学 TMLR 团体) MM Lab, CUHK(CUHK 多模态实验室) RAMS Lab, Huawei Technologies Co., Ltd.(华为技术有限公司 RAMS 实验室)

专题命中 医疗多模态 :diagnosis(abstract);分类 cs.CV

AI总结 针对多模态大模型在多轮对话中因初始错误累积导致幻觉雪崩的问题,提出首个细粒度诊断基准MM-Snowball,并设计无训练的冲突感知视觉校正方法CAVR,通过表示级刷新视觉锚定和logit级修正输出分布来缓解雪崩效应。

Comments Accepted by The International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31093 2026-06-01 cs.CV 57%

Cross-Modal Clinical Knowledge Integration for Mammography Report Generation

跨模态临床知识整合用于乳腺X线报告生成

Jiayi Zhu, Fuxiang Huang, Yu Xie, Xi Wang, Zhixuan Chen, Yuan Guo, Qingcong Kong, Zhenhui Li, Qiong Luo, Hao Chen

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Lingnan University(岭南大学) The Third Affiliated Hospital of Kunming Medical University, Yunnan Cancer Hospital, Peking University Cancer Hospital Yunnan(昆明医科大学第三附属医院、云南癌症医院、北京大学肿瘤医院云南分院) Guangzhou First People's Hospital, South China University of Technology(广州第一人民医院、华南理工大学) The Third Affiliated Hospital, Sun Yat-Sen University(中山大学第三附属医院) HKUST Shenzhen-Hong Kong Collaborative Innovation Research Institute(香港科技大学深圳-香港协同创新研究院)

专题命中 医疗多模态 :diagnosis(abstract);分类 cs.CV

AI总结 提出MammoRG框架,通过两阶段训练模拟临床报告流程,整合BI-RADS指南和先验知识,提升报告生成的临床一致性。

Comments 16 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15710 2026-06-01 cs.CV 57%

UniMedVL: Unifying Medical Multimodal Understanding and Generation through Observation-Knowledge-Analysis

UniMedVL: 通过观察-知识-分析统一医学多模态理解与生成

Junzhi Ning, Wei Li, Cheng Tang, Jiashi Lin, Chenglong Ma, Chaoyang Zhang, Jiyao Liu, Ying Chen, Shujian Gao, Yuandong Pu, Huihui Xu, Chenhui Gou, Ziyan Huang, Yi Xin, Qi Qin, Diping Song, Bin Fu, Guang Yang, Yuanfeng Ji, Tianbin Li, Yanzhou Su, Jin Ye, Shixiang Tang, Zhongying Deng, Lihao Liu, Ming Hu, Junjun He

机构 * Shanghai Artificial Intelligence Laboratory Shanghai Innovation Institute Shanghai Jiao Tong University Shanghai Institute of Optics Fudan University University of Cambridge Monash University DAMO Academy, Alibaba Group Imperial College London The University of Hong Kong The Hong Kong University of Science Hupan Lab The Chinese University of Hong Kong

专题命中 医疗多模态 :medical AI(abstract);分类 cs.CV

AI总结 提出首个统一医学模型UniMedVL,通过渐进式训练流水线融合多模态理解与生成能力,并在8种影像模态的5.6M实例数据集上验证其性能。

Comments This submission has been converted to the ICML template

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27916 2026-05-28 cs.CV cs.CL 57%

OphIn-500K: Curating Web-Scale Visual Instructions for Scaling Ophthalmic Multimodal Large Language Models

OphIn-500K:策划网络规模的视觉指令以扩展眼科多模态大语言模型

Xuanzhao Dong, Wenhui Zhu, Xiwen Chen, Hao Wang, Xin Li, Yujian Xiong, Jiajun Cheng, Jingjing Wang, Xiaobing Yu, Haiyu Wu, Shao Tang, Zhipeng Wang, Langechuan Liu, Shan Lin, Oana Dumitrascu, Yalin Wang

机构 * Arizona State University(亚利桑那州立大学) Clemson University(克莱姆森大学) Washington University in St. Louis(圣路易斯华盛顿大学) University of Notre Dame(诺特丹大学) Florida State University(佛罗里达州立大学) Rice University(里德大学) NVIDIA(英伟达) Mayo Clinic(梅奥诊所)

专题命中 医疗多模态 :diagnosis(abstract);分类 cs.CV

AI总结 提出OphIn-Engine流水线从网络视频中构建高质量眼科指令数据,生成包含50万+指令实例的OphIn-500K数据集,并基于此开发眼科专用多模态大语言模型OphIn-VL,在多项任务上超越现有通用医学和专用模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27583 2026-05-28 cs.LG 57%

Information-theoretic Multimodal Representation Learning for Electrocardiogram Signals

基于信息论的心电图信号多模态表示学习

Phu X. Nguyen, Konstantinos Kontras, Wei Dai, Huy Phan, Christos Chatzichristos, Paul Pu Liang, Bert Vandenberk, Maarten De Vos

机构 * KU Leuven(库勒芬大学) University Hospitals Leuven(鲁文大学医院) MIT(麻省理工学院) DFKI(德国达姆施塔特研究所)

专题命中 医疗多模态 :diagnosis(abstract);分类 cs.LG

AI总结 提出MERIT框架,通过信息论视角结合掩码心电图建模与心电图-文本对比对齐,学习保留信号结构并整合临床语义的心电图表示,在分类、零样本和文本生成任务中取得一致提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25540 2026-05-26 cs.SD cs.LG 57%

A Multimodal Framework for Dementia Detection via Linguistic and Acoustic Representation Learning

基于语言和声学表征学习的多模态痴呆检测框架

Loukas Ilias, Dimitris Askounis

机构 * Decision Support Systems Laboratory, School of Electrical and Computer Engineering, National Technical University of Athens(决策支持系统实验室,电气与计算机工程学院,国家技术大学雅典)

专题命中 医疗多模态 :diagnosis(abstract);分类 cs.LG

AI总结 提出一个端到端可训练的多模态深度学习框架,通过预训练模型提取声学和文本特征,结合注意力融合与互信息最大化,实现自动痴呆检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20772 2026-05-26 cs.CV 57%

VIHD: Visual Intervention-based Hallucination Detection for Medical Visual Question Answering

VIHD: 基于视觉干预的医学视觉问答幻觉检测

Jiayi Chen, Benteng Ma, Zehui Liao, Winston Chong, Yasmeen George, Jianfei Cai

机构 * Department of Data Science \& AI, Faculty of Information Technology, Monash University, Melbourne, VIC 3800, Australia Alfred Health Radiology, Alfred Health, Melbourne, VIC 3004, Australia School of Translational Medicine, Faculty of Medicine, Nursing Health Sciences, Monash University, Melbourne, VIC 3800, Australia Hong Kong Polytechnic University, Hong Kong SAR, China

专题命中 医疗多模态 :diagnosis(abstract);分类 cs.CV

AI总结 提出VIHD方法,通过视觉依赖探测和视觉干预解码校准语义熵,有效检测医学多模态大语言模型中的幻觉响应。

Comments Early accepted by MICCAI 2026. This version of the contribution has been accepted for publication, after peer review (when applicable) but is not the Version of Record and does not reflect post-acceptance improvements, or any corrections

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24977 2026-05-26 cs.CV cs.CL 57%

Universal Boosts, Specific Suppressors: Sparse Autoencoder Steering of Medical Vision-Language Models

通用增强,特定抑制:基于稀疏自编码器引导的医学视觉语言模型

Farhad Nooralahzadeh, Benjamin Gundersen, Nicolas Deperrois, Hidetoshi Matsuom, Mizuho Nishio, Thomas Frauenfelder, Ahmed Allam, Christian Blüthgen, Michael Moor, Michael Krauthammer

机构 * University of Zurich and University Hospital of Zurich(苏黎世大学及苏黎世大学医院) Kobe University(Kobe大学) ETH AI Center(苏黎世联邦理工学院人工智能中心) ETH Zurich(苏黎世联邦理工学院) Stanford University(斯坦福大学) Zurich University of Applied Sciences(苏黎世应用科学大学)

专题命中 医疗多模态 :radiology(abstract);分类 cs.CV

AI总结 本文提出一种无需权重更新的解码时残差引导方法,通过每token稀疏自编码器(SAE)对医学视觉语言模型进行干预,抑制幻觉并提升报告质量,在多个模型上取得显著改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24684 2026-05-26 cs.LG cs.AI 57%

Beyond the Aggregation Dilemma: Prior-Retaining Decoupled Learning for Multimodal Graphs

超越聚合困境:多模态图的先验保持解耦学习

Hao Yan, Xuanru Wang, Jun Yin, Shirui Pan, Senzhang Wang, Chengqi Zhang

机构 * School of Computer Science and Engineering, Central South University(中南大学计算机科学与工程学院) Department of Data Science and Artificial Intelligence, The Hong Kong Polytechnic University(香港理工大学数据科学与人工智能系) School of Information and Communication Technology, Griffith University(格里菲斯大学信息与通信技术学院)

专题命中 医疗多模态 :pathology(abstract);分类 cs.LG

AI总结 针对多模态属性图学习中强制聚合导致性能反转的聚合困境,提出解耦双路径架构SUPRA,通过保持先验特征的独立性和轻量级共享GNN捕获结构协同,并辅以深度监督缓解梯度饥饿,实现SOTA性能且显著降低计算开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21652 2026-05-26 cs.CV cs.AI 57%

Look-Closer-Then-Diagnose: Confidence-Aware Ultrasound VQA via Active Zooming

Look-Closer-Then-Diagnose: 通过主动缩放实现置信度感知的超声VQA

Yue Zhou, Erxuan Wu, Yikang Sun, Hongjoo Lee, Yuan Bi, Huixiong Xu, Nassir Navab, Zhongliang Jiang

机构 * Computer Aided Medical Procedures (CAMP)(计算机辅助医疗程序) TU Munich, Germany(慕尼黑工业大学,德国) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) Munich, Germany(慕尼黑,德国) Zhongshan Hospital, Fudan University, China(复旦大学中山医院) The University of Hong Kong, Hongkong, China(香港大学,香港,中国)

专题命中 医疗多模态 :diagnosis(abstract);分类 cs.CV

AI总结 提出一个模拟超声医师认知流程的框架,通过“缩放-诊断”范式和基于组相对策略优化的不确定性感知奖励,提升超声视觉问答中病灶定位和诊断性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19027 2026-05-26 cs.CV 57%

MedFM-Robust: Benchmarking Robustness of Medical Foundation Models

MedFM-Robust:医学基础模型的鲁棒性基准测试

Xiangxiang Cui, Tianjin Huang, Yifang Wang, Lijie Hu, Lu Yin

机构 * Beijing Normal University, China(北京师范大学) University of Exeter, United Kingdom(埃克塞特大学) University College London, United Kingdom(伦敦大学学院) Mohamed bin Zayed University of Artificial Intelligence, United Arab Emirates(穆罕默德·本·扎耶德人工智能大学) University of Surrey, United Kingdom(萨里大学)

专题命中 医疗多模态 :medical AI(abstract);分类 cs.CV

AI总结 本文提出了一个包含40种扰动类型(12种基础、28种医学特定)的鲁棒性基准,评估了多种医学基础模型在VQA、视觉定位、图像描述和分割任务上的表现,发现微调策略主导鲁棒性、医学特定扰动对分割影响大、零样本VQA鲁棒性依赖模型等关键结论。

Comments MICCAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17879 2026-05-25 cs.CV cs.AI 57%

Anatomy-Guided Vision-Language Learning with Angular Prototype Separation for Multi-Label Video Capsule Endoscopy Classification Under Class Imbalance

解剖引导的视觉-语言学习与角度原型分离用于类别不平衡下的多标签视频胶囊内镜分类

Podakanti Satyajith Chary, Nagarajan Ganapathy

机构 * Department of Engineering Science, IIT Hyderabad(印度海得拉尔理工学院工程科学系) Department of Biomedical Engineering, IIT Hyderabad(印度海得拉尔理工学院生物医学工程系)

专题命中 医疗多模态 :biomedical(abstract);分类 cs.CV

AI总结 针对视频胶囊内镜多标签分类中的极端类别不平衡问题,提出结合角度分离损失和生物状态机解码器的框架,利用解剖上下文和原型学习提升罕见类检测性能。

Comments 12 pages, 1 figure, ICPR 2026 RARE-VISION Competition

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02719 2026-05-25 cs.LG 57%

An Empirical Analysis of Calibration and Selective Prediction in Multimodal Clinical Condition Classification

多模态临床状况分类中的校准与选择性预测的实证分析

L. Julián Lechuga López, Farah E. Shamout, Tim G. J. Rudner

机构 * New York University(纽约大学) University of Toronto(多伦多大学)

专题命中 医疗多模态 :clinical AI(abstract);分类 cs.LG

AI总结 本研究通过实证分析多标签临床状况分类中基于不确定性的选择性预测,发现其性能可能严重下降,原因是类别依赖的误校准,尤其对少数类别,并强调需要校准感知评估来确保临床AI的安全性。

Comments 40 pages, 14 figures, 16 tables. Accepted as a conference paper at AHLI Conference on Health, Inference, and Learning (CHIL) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22414 2026-05-22 cs.CV cs.AI 57%

Towards Clinically Interpretable Ophthalmic VQA via Spatially-Grounded Lesion Evidence

迈向具有空间定位病变证据的临床可解释性眼科VQA

Xingyue Wang, Bo Liu, Meng Wang, Zhixuan Zhang, Chengcheng Zhu, Huazhu Fu, Jiang Liu

机构 * Department of Computer Science and Engineering, Southern University of Science and Technology(南方科技大学计算机科学与工程系) The Hong Kong Polytechnic University(香港理工大学) National University of Singapore(新加坡国立大学) University of Washington(华盛顿大学) Institute of High Performance Computing, Agency for Science, Technology and Research(科技研究局高性能计算研究所)

专题命中 医疗多模态 :diagnosis(abstract);分类 cs.CV

AI总结 本文提出FundusGround基准,通过空间定位病变证据提升眼科VQA的临床可解释性,通过三阶段流程收集标注病变的视网膜影像,并评估多种视觉语言模型在答案准确性和病变层面推理上的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15561 2026-05-18 cs.CV 57%

RoiMAM: Region-of-Interest Medical Attention Model for Efficient Vision-Language Understanding

RoiMAM:面向高效视觉-语言理解的感兴趣区域医学注意模型

Jiayan Yang, Zhuoyu Wu, Wenqi Fang

机构 * Shenzhen Institutes of Advanced Technology, Chinese Academy of Science(深圳先进技术研究院,中国科学院) CyPhi( ) AI Research Lab, School of IT, Monash University, Malaysia Campus(CyPhi人工智能研究实验室,信息学院,墨尔本大学马来西亚校区)

专题命中 医疗多模态 :diagnosis(abstract);分类 cs.CV

AI总结 本文提出RoiMAM,通过整合无训练ROI生成模块和语义选择性抑制,专注于病变相关区域,提升医疗视觉问答的效率与准确性。

Comments under revision

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15235 2026-05-18 cs.LG 57%

MuteBench: Modality Unavailability Tolerance Evaluation for Incomplete Multimodal Fusion

MuteBench: 多模态融合不完整性容忍性评估

Wugeng Zheng, Ziwen Kan, Tianlong Chen, Chen Chen, Song Wang

机构 * University of Central Florida(中央佛罗里达大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 医疗多模态 :clinical AI(abstract);分类 cs.LG

AI总结 MuteBench评估多模态融合在模态缺失和内模态缺失下的鲁棒性,发现架构类型是预测鲁棒性的最强因素,且通道独立模型对模态缺失容忍性高但对内模态缺失敏感。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22853 2026-05-14 cs.CV 57%

Inference-Time Dynamic Modality Selection for Incomplete Multimodal Classification

推理时动态模态选择用于不完整多模态分类

Siyi Du, Xinzhe Luo, Declan P. O'Regan, Chen Qin

机构 * Department of Electrical and Electronic Engineering & I-X(电气与电子工程系及I-X)

专题命中 医疗多模态 :medical image(abstract);分类 cs.CV

AI总结 本文提出DyMo框架,通过动态选择并融合可靠恢复的模态,解决不完整多模态学习中的丢弃或填补困境,实验显示其在多种缺失数据场景下优于现有方法。

Comments 27 pages (including appendix), accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10120 2026-05-12 cs.CV cs.AI 57%

MicroWorld: Empowering Multimodal Large Language Models to Bridge the Microscopic Domain Gap with Multimodal Attribute Graph

MicroWorld: 通过多模态属性图赋能多模态大语言模型,弥合微观领域差距

Manyu Li, Ruian He, Chenxi Ma, Weimin Tan, Bo Yan

机构 * Shanghai Key Laboratory of Intelligent Information Processing(上海智能信息处理关键实验室) School of Computer Science, Fudan University(复旦大学计算机科学学院)

专题命中 医疗多模态 :biomedical(abstract);分类 cs.CV

AI总结 MicroWorld通过构建多模态属性图增强多模态大语言模型在微观领域的能力,无需领域微调即可提升推理性能,实验显示在MicroVQA和MicroBench基准上均取得显著提升。

Comments 29 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08735 2026-05-12 cs.CV 57%

CollabVR: Collaborative Video Reasoning with Vision-Language and Video Generation Models

CollabVR: 基于视觉-语言和视频生成模型的协作视频推理

Joowon Kim, Seungho Shin, Joonhyung Park, Eunho Yang

机构 * KAIST(韩国科学技术院) Kyung Hee University(庆熙大学) AITRICS

专题命中 医疗多模态 :diagnosis(abstract);分类 cs.CV

AI总结 CollabVR通过结合视觉-语言模型与视频生成模型,在步骤级实现协作视频推理,提升多步任务性能,并在基准测试中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08724 2026-05-12 cs.CV 57%

SynerMedGen: Synergizing Medical Multimodal Understanding with Generation via Task Alignment

SynerMedGen:通过任务对齐协同医疗多模态理解与生成

Weiren Zhao, Yi Dong, Cheng Chen

机构 * The University of Hong Kong, Hong Kong, China(香港大学)

专题命中 医疗多模态 :medical image(abstract);分类 cs.CV

AI总结 SynerMedGen通过任务对齐实现医疗多模态理解与生成的协同,提出生成对齐理解任务和两阶段训练策略,实现零样本性能和跨数据集泛化,释放大规模数据集支持进一步研究。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08493 2026-05-12 cs.CV 57%

CapCLIP: A Vision-Language Representation Alignment Approach for Wireless Capsule Endoscopy Analysis

CapCLIP:一种用于无线胶囊内镜分析的视觉-语言表示对齐方法

Haroon Wahab, Irfan Mehmood, Hassan Ugail

机构 * School of Computer Science, AI and Electronics Faculty of Engineering and Digital Technologies(计算机科学与电子工程学院,工程与数字技术学院) School of Management Faculty of Mgmt, Law & Social Sciences(管理学院,管理、法律与社会科学学院) Centre for Visual Computing and Intelligent Systems(视觉计算与智能系统中心)

专题命中 医疗多模态 :pathology(abstract);分类 cs.CV

AI总结 CapCLIP通过将内镜图像与临床标准术语生成的文本描述对齐,提升无线胶囊内镜分析的泛化能力和语义解释性,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏