机构
*
State Key Laboratory of AI Safety(人工智能安全国家重点实验室)
;
Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)
;
University of Chinese Academy of Sciences(中国科学院大学)
;
Meituan(美团)
机构
*
Beijing Jiaotong University(北京交通大学)
;
Hubei Provincial Hospital of Traditional Chinese Medicine(湖北省中医院)
;
Hubei University of Chinese Medicine(湖北中医药大学)
;
Hubei Province Academy of Traditional Chinese Medicine(湖北省中医药研究院)
;
China Academy of Chinese Medical Sciences(中国中医科学院)
;
Xiyuan Hospital(西苑医院)
;
National Clinical Research Center for Chinese Medicine Cardiology(国家中医心血管病临床医学研究中心)
;
Hubei Provincial Clinical Research Center for Acupuncture and Moxibustion in Obesity Treatment(湖北省肥胖病针灸临床研究中心)
;
Hubei Shizhen Laboratory(湖北时珍实验室)
;
Tianjin Ta(天津(此处原文未完整,按原文提取))
Step-Level On-Policy Distillation: Interpolating Between On-Policy Distillation and Supervised Fine-Tuning
步骤级在线策略蒸馏:在线策略蒸馏与监督微调的插值方法
Changhui Sun, Lanbo Liu, Hang Lei, Tong Ling, Jiahang Xie, Zhiyong Zheng, Yujia Wang, Hao Liu, Feng Xiao, Lu Liu, Yanlong Du, Zifeng Cheng, Ziwei Jiang, Qing Gu
机构
*
State Key Laboratory for Novel Software Technology, Nanjing University(南京大学现代软件技术国家重点实验室)
;
XingYun Lab, HUJING Digital Media & Entertainment Group(星云实验室,沪景数字媒体娱乐集团)
;
University of Chinese Academy of Sciences(中国科学院大学)
;
School of Data Science, Fudan University(复旦大学数据科学学院)
CommentsFollow-up to arXiv:2608.10145. All experiments run on a laptop CPU; no model was trained or fine-tuned. Code, checkpoints and every measurement: github.com/joyjeet-singh/tinylab
ResidencyRL: Reinforcement Learning in Simulated Clinical Environments
ResidencyRL:在模拟临床环境中开展的强化学习
Valentin Liévin, Samuel Schmidgall, Tim Strother, Alex Bijamov, Akshay Goel, Anil Palepu, Chunjong Park, Vahid Balazadeh, Min Woo Sun, Marius Guerard, Justin Chen, Dave Steiner, Vikram Dhillon, Ibrahim Azar, Akhil Mehta, Nicholas Spetsieris, Shilpan Shah, Maen Abdelrahim, Amit Dahiya, Yun Liu, Katherine Chou, Yossi Matias, Avinatan Hassidim, Dale R. Webster, Quoc V. Le, Raia Hadsell, Joelle Barral, Carey Radebaugh, Aleksandra Faust, Shekoofeh Azizi, Mike Schaekermann, Po-Hsuan Cameron Chen, Tao Tu, David Racz, Lin Yang
机构
*
Google DeepMind(谷歌DeepMind)
;
Google Research(谷歌研究院)
;
Houston Methodist Hospital(休斯顿卫理公会医院)
;
Trinity Health Group(三一健康集团)
;
Stanford Oncology Partners(斯坦福肿瘤学伙伴)
;
St. Luke Hospital(圣卢克医院)
专题命中
规划决策
:agent(abstract);分类 cs.AI、cs.CL
AI总结
本研究提出 ResidencyRL,通过多轮强化学习训练临床 AI 智能体,在模拟临床环境中提升诊断准确性、降低漏报率,且能力可迁移至多个医学基准测试,为临床 AI 发展提供了新路径。