The Authenticity Gap in Human Evaluation
人类评估中的真实性差距
AI总结 该研究发现NLG评估的标准人工评分协议存在真实性差距,因隐含假设被违反导致无法准确反映人类偏好,提出适用于开放式任务的SPA协议,且SPA能更准确恢复GPT-3模型的排序。
Comments EMNLP 2022
期刊&会议
Conference on Empirical Methods in Natural Language Processing · 会议 · Natural Language Processing
人类评估中的真实性差距
AI总结 该研究发现NLG评估的标准人工评分协议存在真实性差距,因隐含假设被违反导致无法准确反映人类偏好,提出适用于开放式任务的SPA协议,且SPA能更准确恢复GPT-3模型的排序。
Comments EMNLP 2022