Using Human-LLM Disagreement to Improve Checklist-Based Quality Appraisal
利用人类与大语言模型(LLM)的分歧改进基于核查表的质量评估
机构 * Utrecht University(乌得勒支大学)
专题命中 其他LLM :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 本研究探究LLM能否近似基于核查表评估的人类判断,发现人类与LLM的分歧多源于核查表的歧义性和条件性标准,修订此类条目可提升评估一致性,分析分歧还能助力研究综合工作流的迭代改进。
Comments 31 pages, 8 figures