Towards Reliable Medical LLMs: Benchmarking and Enhancing Confidence Estimation of Large Language Models in Medical Consultation
迈向可靠的医疗大语言模型:在真实医疗咨询中评估和增强大语言模型信心估计的基准测试
机构 * Nanyang Technological University(南洋理工大学) ; Wuhan University(武汉大学)
AI总结 本文提出MedConf框架,通过证据引导的语言自评估方法,在医疗咨询中提升大语言模型的信心估计精度与可靠性。