Standardizing Longitudinal Radiology Report Evaluation via Large Language Model Annotation
通过大型语言模型标注标准化纵向放射学报告评估
专题命中 医学数据与评测 :radiology(title,abstract)
AI总结 本文提出基于大型语言模型的标注方法,用于标准化放射学报告中的纵向信息评估,通过对比实验验证了其在疾病进展检测和跟踪方面的优越性能。
科学与医疗
医学智能、临床 AI、医学影像、病理、诊断和医疗健康大模型。
通过大型语言模型标注标准化纵向放射学报告评估
专题命中 医学数据与评测 :radiology(title,abstract)
AI总结 本文提出基于大型语言模型的标注方法,用于标准化放射学报告中的纵向信息评估,通过对比实验验证了其在疾病进展检测和跟踪方面的优越性能。
Rad-R:用于硬件故障诊断的原始ADC雷达数据集与捕获不变SSM
机构 * Georgia Institute of Technology(佐治亚理工学院)
专题命中 医学数据与评测 :diagnosis(title);分类 cs.CV
AI总结 针对汽车毫米波雷达硬件故障数据稀缺问题,提出Rad-R原始ADC雷达数据集与捕获不变RadrNet模型,经基准评估,该模型在受控跨严重程度故障诊断任务中性能优于对比模型,且在其他任务中也表现领先。
PhysDox: 对生理传感协议的物理可行性审计进行LLM基准测试
专题命中 医学数据与评测 :diagnosis(abstract);biomedical(abstract)
AI总结 提出PhysDox基准,通过两阶段评估(严重性检测和约束级诊断)测试LLM对生物医学协议物理可行性的审计能力,发现模型存在支架偏差和隐式约束高漏检率等问题。
Comments 31 Pages,7 Figures
Journal ref EMNLP 2026 (findings)
面向大规模人脸识别数据集的高效、免验证的内在质量评估
机构 * School of Cyber Science and Technology, University of Science and Technology of China(中国科学技术大学网络科学与技术学院)
专题命中 医学数据与评测 :diagnosis(abstract);分类 cs.CV、cs.LG
AI总结 提出一种无需训练的内在质量(IQ)指标,通过邻域一致性得分和全局表示子空间复杂度来估计人脸识别数据集生成高性能模型的潜力,实现快速数据集诊断与筛选。
Comments ICML 2026
视觉医学基础模型的不确定性
机构 * Center for Data Science, New York University(纽约大学数据科学中心) ; NYU Grossman School of Medicine(纽约大学格罗斯曼医学院) ; Department of Population Health, NYU Grossman School of Medicine(纽约大学格罗斯曼医学院人口健康系)
专题命中 医学数据与评测 :medical AI(abstract);分类 cs.LG
AI总结 本研究对比特定领域与通用领域视觉基础模型,探究预训练方式等对不确定性量化的影响,发现特定领域预训练结合自监督学习可提升校准效果,特定领域模型能实现更高效共形预测,强调需整合点与区域预测以增强医疗AI可靠性。
模型何时应改变想法?大语言模型中的上下文信念管理
机构 * Zhejiang University(浙江大学) ; HomologyAI
专题命中 医学数据与评测 :diagnosis(abstract);分类 cs.LG
AI总结 提出上下文信念管理(CBM)框架,通过引入BeliefTrack基准和信念状态奖励的强化学习,将大语言模型在长程交互中的信念更新失败率平均降低70.9%。
Comments Accepted by EMNLP 2026 main conference
EMERGE-Policy:超越单一策略的机器人心智涌现
机构 * Tsinghua University(清华大学) ; Nanjing University of Science and Technology(南京理工大学) ; Xi’an Jiaotong University(西安交通大学) ; Xidian University(西安电子科技大学) ; Harbin Institute of Technology(哈尔滨工业大学) ; Peking University(北京大学) ; Nanyang Technological University(南洋理工大学)
专题命中 医学数据与评测 :diagnosis(abstract)
AI总结 EMERGE-Policy是一种图结构智能体框架,通过多角色子智能体协作划分功能子任务,无需额外微调即可在公开基准和真实机器人实验中实现出色性能,扩展了机器人策略的应用范围。
临床导向的医学语言模型隐私评估
机构 * Stanford University(斯坦福大学) ; Massachusetts Institute of Technology(麻省理工学院) ; American Board of Family Medicine(家庭医学认证委员会)
专题命中 医学数据与评测 :diagnosis(abstract)
AI总结 提出临床导向框架,按对抗访问等级评估医学语言模型隐私泄露,发现常规元数据可导致高比率逐字记忆和敏感诊断恢复,但部分记忆源于模板化文档。
用于代理网络运维和AI运维的大型语言模型:架构、评估与安全
机构 * School of Computing and Communications(计算与通信学院) ; University of Cambridge(剑桥大学) ; School of Software(软件学院) ; Nanjing University of Information Science and Technology(南京信息科技大學) ; TU Wien(维也纳技术大学) ; ICREA
专题命中 医学数据与评测 :diagnosis(abstract)
AI总结 本文探讨了大型语言模型在网络运维和AI运维中的应用,分析了代理架构、评估方法及安全挑战,强调系统可靠性依赖于模型周边机制,而非模型本身。
Comments 59 pages, 13 figures, 8 tables. Survey article. Accompanying evidence-audit dataset available on Mendeley Data, doi: 10.17632/2p5ppxzy4s.3
Pearmut:使翻译的人工评估变得简单
机构 * ETH Zurich(苏黎世联邦理工学院) ; Cohere
专题命中 医学数据与评测 :diagnosis(abstract)
AI总结 Pearmut通过轻量级平台简化多语言NLP的人工评估流程,支持机器翻译任务,提供多种评估协议和动态分配策略,使人工评估成为模型开发的常规环节。
Comments EMNLP 2026 Demo, typeset with Typst
基于3D建模的热图像行人检测器的物理对抗样本
机构 * Tsinghua University(清华大学) ; Chinese Institute for Brain Research (CIBR)(中国脑科学研究院)
专题命中 其他医学AI :medical AI(abstract);分类 cs.CV
AI总结 该研究基于3D建模制作红外对抗服装,针对YOLOv9等热图像行人检测器实现高攻击成功率,且具有良好的可迁移性。
Comments Accepted by TPAMI 2025
MedAgent-R1:面向证据 grounded 医疗推理的忠实性感知强化学习
机构 * Tsinghua University(清华大学) ; DP Technology(第四范式)
专题命中 其他医学AI :medical AI(abstract)
AI总结 MedAgent-R1 针对医疗推理智能体的自信幻觉问题,采用忠实性门控奖励设计,大幅降低引用编造率、提升证据完整性,在 HealthBench Safety 上表现优于 GPT-4o,实现了证据 grounded 的医疗推理优化。