arXivDaily arXiv每日学术速递 周一至周五更新

科学与医疗

医学 AI

医学智能、临床 AI、医学影像、病理、诊断和医疗健康大模型。

2026-09-01 至 2026-09-01 共收录 11 信号源:cs.CV, cs.LG, q-bio, eess.IV, eess.SP

1. 医学数据与评测 11 篇

2606.11208 2026-09-01 cs.CL cs.AI 版本更新 78%

BioDivergence: A Benchmark and Evaluation Framework for Hidden Contextual Contradictions in Biomedical Abstracts

BioDivergence:生物医学摘要中隐藏上下文矛盾的基准与评估框架

Elias Hossain, Sanjeda Sara Jennifer, Sabera Akter Bushra, Niloofar Yousefi

机构 * College of Engineering and Computer Science, University of Central Florida(中佛罗里达大学工程与计算机科学学院) Burnett School of Biomedical Sciences, University of Central Florida(中佛罗里达大学伯内特生物医学科学学院)

专题命中 医学数据与评测 :biomedical(title,abstract)

AI总结 提出BioDivergence框架,通过六类冲突分类、13轴分歧本体和结构化输出,解决现有NLI基准无法捕捉生物医学研究中上下文依赖的差异问题,并发布包含11865个声明对的基准数据集。

Comments The authors have decided to withdraw this manuscript because substantial revisions to the study design, analysis, and presentation are needed before the work is suitable for public dissemination. A revised version may be submitted separately after these issues have been fully addressed

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16753 2026-09-01 cs.CL cs.AI 版本更新 78%

Standardizing Longitudinal Radiology Report Evaluation via Large Language Model Annotation

通过大型语言模型标注标准化纵向放射学报告评估

Xinyi Wang, Grazziela Figueredo, Ruizhe Li, Xin Chen

专题命中 医学数据与评测 :radiology(title,abstract)

AI总结 本文提出基于大型语言模型的标注方法,用于标准化放射学报告中的纵向信息评估,通过对比实验验证了其在疾病进展检测和跟踪方面的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30896 2026-09-01 cs.CV 新提交 74%

Rad-R: A Raw-ADC Radar Dataset and Capture-Invariant SSM for Hardware-Fault Diagnosis

Rad-R:用于硬件故障诊断的原始ADC雷达数据集与捕获不变SSM

Mainak Mallick, Junghwan Yim, Seung-Kyum Choi

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 医学数据与评测 :diagnosis(title);分类 cs.CV

AI总结 针对汽车毫米波雷达硬件故障数据稀缺问题,提出Rad-R原始ADC雷达数据集与捕获不变RadrNet模型,经基准评估,该模型在受控跨严重程度故障诊断任务中性能优于对比模型,且在其他任务中也表现领先。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05003 2026-09-01 cs.HC 67%

PhysDox: Benchmarking LLMs on Physical Feasibility Auditing of Physiological Sensing Protocols

PhysDox: 对生理传感协议的物理可行性审计进行LLM基准测试

He Liu, Boyuan Gu, Shuaiqi Cheng, Haiyang Sun, Siyu You, Xuming Hu

专题命中 医学数据与评测 :diagnosis(abstract);biomedical(abstract)

AI总结 提出PhysDox基准,通过两阶段评估(严重性检测和约束级诊断)测试LLM对生物医学协议物理可行性的审计能力,发现模型存在支架偏差和隐式约束高漏检率等问题。

Comments 31 Pages,7 Figures

Journal ref EMNLP 2026 (findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29720 2026-09-01 cs.CV cs.LG 62%

Efficient, Validation-Free Intrinsic Quality Estimation for Large-Scale Face Recognition Datasets

面向大规模人脸识别数据集的高效、免验证的内在质量评估

Zhichao Chen, Yongle Zhao, Kaicheng Yang, Meng Yang, Yin Xie, Ziyong Feng

机构 * School of Cyber Science and Technology, University of Science and Technology of China(中国科学技术大学网络科学与技术学院)

专题命中 医学数据与评测 :diagnosis(abstract);分类 cs.CV、cs.LG

AI总结 提出一种无需训练的内在质量(IQ)指标,通过邻域一致性得分和全局表示子空间复杂度来估计人脸识别数据集生成高性能模型的潜力,实现快速数据集诊断与筛选。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30390 2026-09-01 cs.LG 新提交 57%

Uncertainty of Vision Medical Foundation Models

视觉医学基础模型的不确定性

Haoxu Huang, Narges Razavian

机构 * Center for Data Science, New York University(纽约大学数据科学中心) NYU Grossman School of Medicine(纽约大学格罗斯曼医学院) Department of Population Health, NYU Grossman School of Medicine(纽约大学格罗斯曼医学院人口健康系)

专题命中 医学数据与评测 :medical AI(abstract);分类 cs.LG

AI总结 本研究对比特定领域与通用领域视觉基础模型,探究预训练方式等对不确定性量化的影响,发现特定领域预训练结合自监督学习可提升校准效果,特定领域模型能实现更高效共形预测,强调需整合点与区域预测以增强医疗AI可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30219 2026-09-01 cs.AI cs.CL cs.LG 版本更新 57%

When Should Models Change Their Minds? Contextual Belief Management in Large Language Models

模型何时应改变想法?大语言模型中的上下文信念管理

Haoming Xu, Weihong Xu, Zongrui Li, Mengru Wang, Yunzhi Yao, Chiyu Wu, Jin Shang, Yu Gong, Shumin Deng

机构 * Zhejiang University(浙江大学) HomologyAI

专题命中 医学数据与评测 :diagnosis(abstract);分类 cs.LG

AI总结 提出上下文信念管理(CBM)框架,通过引入BeliefTrack基准和信念状态奖励的强化学习,将大语言模型在长程交互中的信念更新失败率平均降低70.9%。

Comments Accepted by EMNLP 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29896 2026-09-01 cs.RO 新提交 50%

EMERGE-Policy: A Robot Mind Emerges Beyond a Single Policy

EMERGE-Policy:超越单一策略的机器人心智涌现

Zhirui Fang, Qingchi Yu, Ziyang Chen, Longfei Li, Haoran Ma, Keru Zhou, Xinrun Xu, Samith Va, Yuxuan Hu, Peixuan Song, Qiang Du, Bin Qian, Yongkang Deng, Xin Li, Yezhen Wang, Zhe Li, Hao Luo, Shuyan Li, Ziwei Wang, Weijian Deng, Xiu Li

机构 * Tsinghua University(清华大学) Nanjing University of Science and Technology(南京理工大学) Xi’an Jiaotong University(西安交通大学) Xidian University(西安电子科技大学) Harbin Institute of Technology(哈尔滨工业大学) Peking University(北京大学) Nanyang Technological University(南洋理工大学)

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 EMERGE-Policy是一种图结构智能体框架,通过多角色子智能体协作划分功能子任务,无需额外微调即可在公开基准和真实机器人实验中实现出色性能,扩展了机器人策略的应用范围。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09590 2026-09-01 cs.CL cs.CR 版本更新 50%

Clinically Grounded Privacy Evaluation of Medical LMs

临床导向的医学语言模型隐私评估

Sasha Ronaghi, Sana Tonekaboni, Lena Stempfle, Vivian Utti, Jordan Li Cahoon, Nathaniel Hendrix, Ayin Vala, Marzyeh Ghassemi, Emily Alsentzer

机构 * Stanford University(斯坦福大学) Massachusetts Institute of Technology(麻省理工学院) American Board of Family Medicine(家庭医学认证委员会)

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 提出临床导向框架,按对抗访问等级评估医学语言模型隐私泄露,发现常规元数据可导致高比率逐字记忆和敏感诊断恢复,但部分记忆源于模板化文档。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12729 2026-09-01 cs.NI cs.AI cs.CR 版本更新 50%

Large Language Models for Agentic NetOps and AIOps: Architectures, Evaluation, and Safety

用于代理网络运维和AI运维的大型语言模型:架构、评估与安全

Muhammad Bilal, Jon Crowcroft, Ruizhi Wang, Xiaolong Xu, Schahram Dustdar

机构 * School of Computing and Communications(计算与通信学院) University of Cambridge(剑桥大学) School of Software(软件学院) Nanjing University of Information Science and Technology(南京信息科技大學) TU Wien(维也纳技术大学) ICREA

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 本文探讨了大型语言模型在网络运维和AI运维中的应用,分析了代理架构、评估方法及安全挑战,强调系统可靠性依赖于模型周边机制,而非模型本身。

Comments 59 pages, 13 figures, 8 tables. Survey article. Accompanying evidence-audit dataset available on Mendeley Data, doi: 10.17632/2p5ppxzy4s.3

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02933 2026-09-01 cs.CL cs.HC 版本更新 50%

Pearmut: Human Evaluation of Translation Made Trivial

Pearmut:使翻译的人工评估变得简单

Vilém Zouhar, Tom Kocmi

机构 * ETH Zurich(苏黎世联邦理工学院) Cohere

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 Pearmut通过轻量级平台简化多语言NLP的人工评估流程,支持机器翻译任务,提供多种评估协议和动态分配策略,使人工评估成为模型开发的常规环节。

Comments EMNLP 2026 Demo, typeset with Typst

详情

展开后加载摘要…

URL PDF HTML 收藏