arXivDaily arXiv每日学术速递 周一至周五更新

科学与医疗

医学 AI

医学智能、临床 AI、医学影像、病理、诊断和医疗健康大模型。

2026-01-21 至 2026-01-21 共收录 9 信号源:cs.CV, cs.LG, q-bio, eess.IV, eess.SP

1. 医学数据与评测 9 篇

2601.13268 2026-01-21 cs.AI 78%

Improving the Safety and Trustworthiness of Medical AI via Multi-Agent Evaluation Loops

通过多智能体评估循环提升医疗AI的安全性与可信度

Zainab Ghafoor, Md Shafiqul Islam, Koushik Howlader, Md Rasel Khondokar, Tanusree Bhattacharjee, Sayantan Chakraborty, Adrito Roy, Ushashi Bhattacharjee, Tirtho Roy

机构 * Sonoma State University(索诺玛州立大学) Iowa State University(爱荷华州立大学) University of Dhaka(达卡大学) Notre Dame College(诺特丹学院)

专题命中 医学数据与评测 :medical AI(title,abstract)

AI总结 本文提出多智能体评估循环框架,通过结合DeepSeek R1和Med-PaLM等模型,有效提升医疗AI的安全性和伦理合规性,实现89%的伦理违规减少和92%的风险降级。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12632 2026-01-21 cs.CL cs.IR 78%

BioPulse-QA: A Dynamic Biomedical Question-Answering Benchmark for Evaluating Factuality, Robustness, and Bias in Large Language Models

BioPulse-QA: 一个动态生物医学问答基准,用于评估大型语言模型的事实性、鲁棒性和偏见

Kriti Bhattarai, Vipina K. Keloth, Donald Wright, Andrew Loza, Yang Ren, Hua Xu

专题命中 医学数据与评测 :biomedical(title,abstract)

AI总结 BioPulse-QA是一个动态生物医学问答基准,用于评估大型语言模型在事实性、鲁棒性和偏见方面的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12661 2026-01-21 cs.AI 67%

MedConsultBench: A Full-Cycle, Fine-Grained, Process-Aware Benchmark for Medical Consultation Agents

MedConsultBench: 一个完整周期、细粒度、过程感知的医疗咨询代理基准

Chuhan Qiao, Jianghua Huang, Daxing Zhao, Ziding Liu, Yanjun Shen, Bing Cheng, Wei Lin, Kai Wu

机构 * Meituan(美团)

专题命中 医学数据与评测 :medical AI(abstract);diagnosis(abstract)

AI总结 MedConsultBench通过细粒度过程感知评估医疗咨询代理的完整咨询周期,揭示高诊断准确性背后的效率与安全问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.08763 2026-01-21 cs.CV cs.LG 62%

Beyond Knowledge Silos: Task Fingerprinting for Democratization of Medical Imaging AI

突破知识孤岛:面向医学影像AI的任务指纹化以实现民主化

Patrick Godau, Akriti Srivastava, Constantin Ulrich, Tim Adler, Klaus Maier-Hein, Lena Maier-Hein

机构 * National Center for Tumor Diseases (NCT)(肿瘤疾病国家中心) German Cancer Research Center (DKFZ) Heidelberg(德国癌症研究中心(Heidelberg)) Faculty of Mathematics and Computer Science(数学和计算机科学学院) Heidelberg University(海德堡大学) HIDSS4Health - Helmholtz Information and Data Science School for Health(HIDSS4Health - 健康信息与数据科学学校) Medical Faculty(医学学院) Pattern Analysis and Learning Group(模式分析与学习小组)

专题命中 医学数据与评测 :medical image(abstract);分类 cs.CV、cs.LG

AI总结 本文提出了一种基于任务指纹的医学影像AI知识转移框架,通过量化任务相似性促进知识共享与协作模型训练,提升AI在医学影像领域的民主化进程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14084 2026-01-21 cs.CV cs.AI cs.CL 57%

DermaBench: A Clinician-Annotated Benchmark Dataset for Dermatology Visual Question Answering and Reasoning

DermaBench:一种用于皮肤科视觉问答和推理的临床标注基准数据集

Abdurrahim Yilmaz, Ozan Erdem, Ece Gokyayla, Ayda Acar, Burc Bugra Dagtas, Dilara Ilhan Erdil, Gulsum Gencoglan, Burak Temelkuran

机构 * Imperial College London(帝国理工学院伦敦分校) Istanbul Medeniyet University(伊斯坦布尔医学大学) Usak Research and Training Hospital(Usak研究与培训医院) Istanbul Research and Training Hospital(伊斯坦布尔研究与培训医院) Ipswich Hospital(伊普斯韦奇医院) Medicana Atakoy Hospital(Medicana阿塔基医院)

专题命中 医学数据与评测 :diagnosis(abstract);分类 cs.CV

AI总结 DermaBench是首个由临床专家标注的皮肤科视觉问答基准数据集,通过精细标注和开放式描述提升多模态模型在皮肤科图像理解与临床推理中的评估能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12382 2026-01-21 cs.CV 57%

A Hierarchical Benchmark of Foundation Models for Dermatology

基础模型在皮肤病学中的分层基准

Furkan Yuceyalcin, Abdurrahim Yilmaz, Burak Temelkuran

机构 * Yildiz Technical University(伊兹密尔技术大学) Imperial College London(伦敦帝国学院)

专题命中 医学数据与评测 :medical image(abstract);分类 cs.CV

AI总结 本研究提出分层评估框架,揭示基础模型在皮肤病学中的粒度能力差异,强调专用模型在细粒度诊断中的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11559 2026-01-21 cs.AI cs.CL cs.LG 57%

MIMIC-RD: Can LLMs differentially diagnose rare diseases in real-world clinical settings?

MIMIC-RD: 能否在真实临床环境中让大语言模型对罕见病进行差异性诊断?

Zilal Eiz AlDin, John Wu, Jeffrey Paul Fung, Jennifer King, Mya Watts, Lauren ONeill, Adam Richard Cross, Jimeng Sun

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Illinois College of Medicine(伊利诺伊大学医学学院)

专题命中 医学数据与评测 :diagnosis(abstract);分类 cs.LG

AI总结 MIMIC-RD通过直接映射临床文本实体到Orphanet,评估LLM在真实临床环境下的罕见病差异性诊断能力,发现现有模型表现不佳,揭示了临床需求与现有能力之间的差距。

Comments 5 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.14581 2026-01-21 stat.AP cs.CR econ.EM 50%

Assessing Utility of Differential Privacy for RCTs

评估差分隐私在随机对照试验中的效用

Kaitlyn R. Webb, Soumya Mukherjee, Aratrika Mustafi, Aleksandra Slavković, Lars Vilhuber

专题命中 医学数据与评测 :biomedical(abstract)

AI总结 本文评估了差分隐私技术在保护RCT数据隐私时的效用,通过模拟研究展示了隐私保护方法对数据分析的影响。

Comments Submitted

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05080 2026-01-21 cs.CL 50%

An Architectural Advantage of The Instruction-Tuned LLM in Containing The Readability-Accuracy Tension in Text Simplification

指令调优LLM在文本简化中缓解可读性-准确性张力的优势

P. Bilha Githinji, Aikaterini Meilliou, Zeming Liang, Lian Zhang, Peiwu Qin

专题命中 医学数据与评测 :biomedical(abstract)

AI总结 本研究通过比较指令调优和推理增强的LLM,发现指令调优在文本简化中能更有效平衡可读性与准确性,提升话语忠实度。

详情

展开后加载摘要…

URL PDF HTML 收藏