An evidence-guided reinforcement learning method to improve psychiatric reasoning in small language models
评估一种证据引导的强化学习框架在对齐光参数大语言模型与精神科临床推理决策认知中的作用
机构 * The Chinese University of Hong Kong, Shatin, N.T., Hong Kong SAR, China(香港中文大学) ; Shandong University, Jinan, China(山东大学) ; Peking University Sixth Hospital, Beijing, China(北京大学第六医院) ; Inspur Cloud Information Technology Co., Ltd., Jinan, China(Inspur 云技术有限公司) ; Fudan University, Shanghai, China(复旦大学) ; Shandong Provincial Hospital Affiliated to Shandong First Medical University, Jinan, China(山东第一医科大学附属山东省人民医院) ; Jilin University, Changchun, China(吉林大学) ; Hong Kong ICI Cloud Service Limited, Hong Kong SAR, China(香港ICI云服务有限公司) ; Shandong First Medical University, Jinan, China(山东第一医科大学)
专题命中 隐私与版权 :alignment(abstract);分类 cs.CL
AI总结 本研究提出ClinMPO框架,通过证据引导的强化学习使轻量LLM在复杂精神病学推理任务中达到超越人类的准确率。
Comments 28 pages, 4 figures