arXivDaily arXiv每日学术速递 周一至周五更新

科学与医疗

医学 AI

医学智能、临床 AI、医学影像、病理、诊断和医疗健康大模型。

2026-09-01 至 2026-09-01 共收录 132 信号源:cs.CV, cs.LG, q-bio, eess.IV, eess.SP

1. 医学数据与评测 11 篇

2601.16753 2026-09-01 cs.CL cs.AI 版本更新 78%

Standardizing Longitudinal Radiology Report Evaluation via Large Language Model Annotation

通过大型语言模型标注标准化纵向放射学报告评估

Xinyi Wang, Grazziela Figueredo, Ruizhe Li, Xin Chen

专题命中 医学数据与评测 :radiology(title,abstract)

AI总结 本文提出基于大型语言模型的标注方法,用于标准化放射学报告中的纵向信息评估,通过对比实验验证了其在疾病进展检测和跟踪方面的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30896 2026-09-01 cs.CV 新提交 74%

Rad-R: A Raw-ADC Radar Dataset and Capture-Invariant SSM for Hardware-Fault Diagnosis

Rad-R:用于硬件故障诊断的原始ADC雷达数据集与捕获不变SSM

Mainak Mallick, Junghwan Yim, Seung-Kyum Choi

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 医学数据与评测 :diagnosis(title);分类 cs.CV

AI总结 针对汽车毫米波雷达硬件故障数据稀缺问题,提出Rad-R原始ADC雷达数据集与捕获不变RadrNet模型,经基准评估,该模型在受控跨严重程度故障诊断任务中性能优于对比模型,且在其他任务中也表现领先。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05003 2026-09-01 cs.HC 67%

PhysDox: Benchmarking LLMs on Physical Feasibility Auditing of Physiological Sensing Protocols

PhysDox: 对生理传感协议的物理可行性审计进行LLM基准测试

He Liu, Boyuan Gu, Shuaiqi Cheng, Haiyang Sun, Siyu You, Xuming Hu

专题命中 医学数据与评测 :diagnosis(abstract);biomedical(abstract)

AI总结 提出PhysDox基准,通过两阶段评估(严重性检测和约束级诊断)测试LLM对生物医学协议物理可行性的审计能力,发现模型存在支架偏差和隐式约束高漏检率等问题。

Comments 31 Pages,7 Figures

Journal ref EMNLP 2026 (findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29720 2026-09-01 cs.CV cs.LG 62%

Efficient, Validation-Free Intrinsic Quality Estimation for Large-Scale Face Recognition Datasets

面向大规模人脸识别数据集的高效、免验证的内在质量评估

Zhichao Chen, Yongle Zhao, Kaicheng Yang, Meng Yang, Yin Xie, Ziyong Feng

机构 * School of Cyber Science and Technology, University of Science and Technology of China(中国科学技术大学网络科学与技术学院)

专题命中 医学数据与评测 :diagnosis(abstract);分类 cs.CV、cs.LG

AI总结 提出一种无需训练的内在质量(IQ)指标,通过邻域一致性得分和全局表示子空间复杂度来估计人脸识别数据集生成高性能模型的潜力,实现快速数据集诊断与筛选。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30390 2026-09-01 cs.LG 新提交 57%

Uncertainty of Vision Medical Foundation Models

视觉医学基础模型的不确定性

Haoxu Huang, Narges Razavian

机构 * Center for Data Science, New York University(纽约大学数据科学中心) NYU Grossman School of Medicine(纽约大学格罗斯曼医学院) Department of Population Health, NYU Grossman School of Medicine(纽约大学格罗斯曼医学院人口健康系)

专题命中 医学数据与评测 :medical AI(abstract);分类 cs.LG

AI总结 本研究对比特定领域与通用领域视觉基础模型,探究预训练方式等对不确定性量化的影响,发现特定领域预训练结合自监督学习可提升校准效果,特定领域模型能实现更高效共形预测,强调需整合点与区域预测以增强医疗AI可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30219 2026-09-01 cs.AI cs.CL cs.LG 版本更新 57%

When Should Models Change Their Minds? Contextual Belief Management in Large Language Models

模型何时应改变想法?大语言模型中的上下文信念管理

Haoming Xu, Weihong Xu, Zongrui Li, Mengru Wang, Yunzhi Yao, Chiyu Wu, Jin Shang, Yu Gong, Shumin Deng

机构 * Zhejiang University(浙江大学) HomologyAI

专题命中 医学数据与评测 :diagnosis(abstract);分类 cs.LG

AI总结 提出上下文信念管理(CBM)框架,通过引入BeliefTrack基准和信念状态奖励的强化学习,将大语言模型在长程交互中的信念更新失败率平均降低70.9%。

Comments Accepted by EMNLP 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29896 2026-09-01 cs.RO 新提交 50%

EMERGE-Policy: A Robot Mind Emerges Beyond a Single Policy

EMERGE-Policy:超越单一策略的机器人心智涌现

Zhirui Fang, Qingchi Yu, Ziyang Chen, Longfei Li, Haoran Ma, Keru Zhou, Xinrun Xu, Samith Va, Yuxuan Hu, Peixuan Song, Qiang Du, Bin Qian, Yongkang Deng, Xin Li, Yezhen Wang, Zhe Li, Hao Luo, Shuyan Li, Ziwei Wang, Weijian Deng, Xiu Li

机构 * Tsinghua University(清华大学) Nanjing University of Science and Technology(南京理工大学) Xi’an Jiaotong University(西安交通大学) Xidian University(西安电子科技大学) Harbin Institute of Technology(哈尔滨工业大学) Peking University(北京大学) Nanyang Technological University(南洋理工大学)

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 EMERGE-Policy是一种图结构智能体框架,通过多角色子智能体协作划分功能子任务,无需额外微调即可在公开基准和真实机器人实验中实现出色性能,扩展了机器人策略的应用范围。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09590 2026-09-01 cs.CL cs.CR 版本更新 50%

Clinically Grounded Privacy Evaluation of Medical LMs

临床导向的医学语言模型隐私评估

Sasha Ronaghi, Sana Tonekaboni, Lena Stempfle, Vivian Utti, Jordan Li Cahoon, Nathaniel Hendrix, Ayin Vala, Marzyeh Ghassemi, Emily Alsentzer

机构 * Stanford University(斯坦福大学) Massachusetts Institute of Technology(麻省理工学院) American Board of Family Medicine(家庭医学认证委员会)

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 提出临床导向框架,按对抗访问等级评估医学语言模型隐私泄露,发现常规元数据可导致高比率逐字记忆和敏感诊断恢复,但部分记忆源于模板化文档。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12729 2026-09-01 cs.NI cs.AI cs.CR 版本更新 50%

Large Language Models for Agentic NetOps and AIOps: Architectures, Evaluation, and Safety

用于代理网络运维和AI运维的大型语言模型:架构、评估与安全

Muhammad Bilal, Jon Crowcroft, Ruizhi Wang, Xiaolong Xu, Schahram Dustdar

机构 * School of Computing and Communications(计算与通信学院) University of Cambridge(剑桥大学) School of Software(软件学院) Nanjing University of Information Science and Technology(南京信息科技大學) TU Wien(维也纳技术大学) ICREA

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 本文探讨了大型语言模型在网络运维和AI运维中的应用,分析了代理架构、评估方法及安全挑战,强调系统可靠性依赖于模型周边机制,而非模型本身。

Comments 59 pages, 13 figures, 8 tables. Survey article. Accompanying evidence-audit dataset available on Mendeley Data, doi: 10.17632/2p5ppxzy4s.3

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02933 2026-09-01 cs.CL cs.HC 版本更新 50%

Pearmut: Human Evaluation of Translation Made Trivial

Pearmut:使翻译的人工评估变得简单

Vilém Zouhar, Tom Kocmi

机构 * ETH Zurich(苏黎世联邦理工学院) Cohere

专题命中 医学数据与评测 :diagnosis(abstract)

AI总结 Pearmut通过轻量级平台简化多语言NLP的人工评估流程,支持机器翻译任务,提供多种评估协议和动态分配策略,使人工评估成为模型开发的常规环节。

Comments EMNLP 2026 Demo, typeset with Typst

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他医学AI 2 篇

2608.30839 2026-09-01 cs.CV 新提交 57%

Physical Adversarial Examples for Person Detectors in Thermal Images Based on 3D Modeling

基于3D建模的热图像行人检测器的物理对抗样本

Xiaopei Zhu, Siyuan Huang, Zhanhao Hu, Jianmin Li, Jun Zhu, Xiaolin Hu

机构 * Tsinghua University(清华大学) Chinese Institute for Brain Research (CIBR)(中国脑科学研究院)

专题命中 其他医学AI :medical AI(abstract);分类 cs.CV

AI总结 该研究基于3D建模制作红外对抗服装,针对YOLOv9等热图像行人检测器实现高攻击成功率,且具有良好的可迁移性。

Comments Accepted by TPAMI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30676 2026-09-01 cs.AI 新提交 50%

MedAgent-R1: Faithfulness-Aware Reinforcement Learning for Evidence-Grounded Medical Reasoning

MedAgent-R1:面向证据 grounded 医疗推理的忠实性感知强化学习

Jiangwang Chen, Chenghao Zhang, Hengxing Cai

机构 * Tsinghua University(清华大学) DP Technology(第四范式)

专题命中 其他医学AI :medical AI(abstract)

AI总结 MedAgent-R1 针对医疗推理智能体的自信幻觉问题,采用忠实性门控奖励设计,大幅降低引用编造率、提升证据完整性,在 HealthBench Safety 上表现优于 GPT-4o,实现了证据 grounded 的医疗推理优化。

详情

展开后加载摘要…

URL PDF HTML 收藏