arXivDaily arXiv每日学术速递 周一至周五更新

科学与医疗

医学 AI

医学智能、临床 AI、医学影像、病理、诊断和医疗健康大模型。

2026-09-01 至 2026-09-01 共收录 8 信号源:cs.CV, cs.LG, q-bio, eess.IV, eess.SP

1. 医疗多模态 8 篇

2608.20743 2026-09-01 cs.AI 版本更新 71%

Is Multimodal Speculative Decoding Ready for Diffusion-Based Parallel Drafting? A Survey and Empirical Diagnosis

多模态推测解码是否适用于基于扩散的并行草稿生成?一项调查与实证诊断

Yantao Li, Huanlin Gao, Fang Zhao, Chao Tan, Qiang Hui, Shuting Liu, Fuyuan Shi, Ting Lu, Shaoan Zhao, Xueqiang Guo, Xinpei Su, Jianbing Zhang, Xinyu Dai, Kai Wang, Shiguo Lian

机构 * Data Science & Artificial Intelligence Research Institute, China Unicom(中国联通数据科学与人工智能研究院) Unicom Data Intelligence, China Unicom(中国联通数据智能)

专题命中 医疗多模态 :diagnosis(title)

AI总结 本文通过调查多模态模型并开展跨架构实证研究,探究多模态推测解码是否适用于基于扩散的并行草稿生成,提出统一分类法并分析现有方法的局限性与未来方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29996 2026-09-01 cs.CV cs.AI cs.LG 新提交 62%

Partition-Aware Unlearning for Removing Spurious Correlations in Large Vision-Language Models

用于移除大型视觉语言模型中虚假关联的感知分区式遗忘

Aditi Sarker, Nazreen Shah, Rafi Ibn Sultan, Rhongho Jang, Dongxiao Zhu, Prashant Khanduri

机构 * Wayne State University(韦恩州立大学) IIIT Delhi(德里印度信息技术学院) Institute for AI and Data Science (AIDaS), Wayne State University(韦恩州立大学人工智能与数据科学研究所)

专题命中 医疗多模态 :diagnosis(abstract);分类 cs.CV、cs.LG

AI总结 本研究提出PURGE框架,通过结构化数据集构建和感知分区式遗忘,减少大型视觉语言模型的虚假关联诱导错误,同时保持或提升整体性能。

Comments 35 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29235 2026-09-01 cs.CV 新提交 57%

Uncertainty-Aware Multimodal Anti-UAV Detection via Evidential Fusion and Conflict-Discounted Belief Aggregation

基于证据融合与冲突折扣信念聚合的不确定性感知多模态反无人机检测

Sharanda Suttorp, Seyed Sahand Mohammadi Ziabari, Ali Mohammed Mansour Alsahag

机构 * University of Amsterdam(阿姆斯特丹大学) SUNY Empire State University(纽约州立大学帝国州立大学)

专题命中 医疗多模态 :diagnosis(abstract);分类 cs.CV

AI总结 针对现有多模态反无人机检测未建模不确定性的问题,本文扩展EDTC提出DBF方法实现多模态融合,在Anti-UAV基准上达到0.670准确率、至少38 FPS,校准良好但定位失败检测能力弱于空间方差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29193 2026-09-01 cs.LG 新提交 57%

HalluPrism: When Multimodal Uncertainty Should Diagnose, Not Decide

HalluPrism:多模态不确定性应用于诊断而非决策

Aman Prakash, Sourish Dasgupta, Tanmoy Chakraborty

机构 * Indian Institute of Technology Delhi(德里印度理工学院) Dhirubhai Ambani University(德鲁巴伊·安巴尼大学)

专题命中 医疗多模态 :diagnosis(abstract);分类 cs.LG

AI总结 该研究提出HalluPrism,通过视觉扰动敏感性等三维特征诊断多模态大语言模型的失败类别,提升了失败检测的AUROC,明确多模态不确定性应先诊断再决策。

Comments Accepted to Findings of EMNLP 2026. 52 pages, 1 figure, 46 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27004 2026-09-01 cs.CV 版本更新 57%

MVC-Bench: Benchmarking Calibration of Medical Vision-Language Models

MVC-Bench:医学视觉-语言模型的校准基准测试

Ashshak Sharifdeen, Shihab Aaqil Ahamed, Ufaq Khan, Muhammad Akhtar Munir, Sujair Ibrahim, Mohamed Rafeek Mareer Ahamed, Yutong Xie, Imran Razzak, Muhammad Haris Khan

机构 * Mohamed bin Zayed University of AI(穆罕默德·本·扎耶德人工智能大学) Sabaragamuwa University of Sri Lanka(斯里兰卡萨巴拉加穆瓦大学) Digital Platform Development, SLT PLC(SLT公共有限公司数字平台开发部)

专题命中 医疗多模态 :medical image(abstract);分类 cs.CV

AI总结 该研究针对医学视觉-语言模型校准不足的问题,提出以校准为核心的基准MVC-Bench,通过多维度评估并提出MCM正则化方法,为医疗工作流提供校准改进指导。

Comments Accepted in EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30725 2026-09-01 cs.CL 新提交 50%

Where Do Multilingual Vision-Language Encoders Fail on Low-Resource Languages?

多模态视觉-语言编码器在低资源语言上的失效位置

Donghoon Han, SungHyun Moon, Aidyn Zhakatayev, Junghun Cha, SeungJae Lee

机构 * Dnotitia Inc.(Dnotitia公司)

专题命中 医疗多模态 :diagnosis(abstract)

AI总结 本文针对多模态视觉-语言编码器在低资源语言上的检索性能差距,发现其源于序列结束符隐藏状态的语言轨迹随深度发散,通过调整序列结束符可显著提升低资源语言检索性能,且不损害高资源语言表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30352 2026-09-01 cs.AI cs.HC 新提交 50%

Co-Annotator: Expert-Distilled ViT and VLM for Visual and Documentation Guidance in Age-Related Macular Degeneration

Co-Annotator:用于年龄相关性黄斑变性视觉与文档指导的专家蒸馏ViT及VLM

Ziheng "Leo" Li, Benjamin Freeman, Akshay Raman, Kavin Aravindhan Rajkumar, Xinxin Fang, Rishabh Srivastava, Steven Feiner, Kaveri A. Thakoor

机构 * Columbia University(哥伦比亚大学)

专题命中 医疗多模态 :clinical AI(abstract)

AI总结 本研究提出Co-Annotator,将专家注视与口述提炼为AOI指导的ViT和生物标志物预填充的VLM,在AMD诊断中联合应用可显著提升效率且不降低准确率。

Comments 23 pages, 11 figures. To appear in UIST '26: Proceedings of the 39th Annual ACM Symposium on User Interface Software and Technology, November 02-05, 2026, Detroit, MI, USA. DOI: 10.1145/3830398.3830722

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30204 2026-09-01 cs.CL 新提交 50%

When Models Hear What They Expect: Diagnosing Prosodic Heuristics in Multimodal Sarcasm Detection

当模型“听到”它们所期待的:诊断多模态讽刺检测中的韵律启发式算法

Yongjian Chen, Pengfei Wei, Yiqun Sun, Zhu Li, Lawrence B. Hsieh

机构 * Magellan Technology Research Institute (MTRI)(麦哲伦技术研究所(MTRI)) Center for Language and Cognition, University of Groningen(格罗宁根大学语言与认知中心)

专题命中 医疗多模态 :diagnosis(abstract)

AI总结 本文以讽刺检测为切入点,评估Qwen2.5-Omni等多模态大语言模型,发现模型依赖音高升高、停顿不规则的韵律刻板印象,操控该维度可使假阳性率达60%,且该效应可跨模型复现。

Comments Accepted to EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏