arXivDaily arXiv每日学术速递 周一至周五更新

作者

Dan Jurafsky

Natural Language Processing

2026-08-19 至 2026-08-19 共收录 1
2205.11930 2026-08-19 cs.CL cs.AI cs.LG 版本更新

The Authenticity Gap in Human Evaluation

人类评估中的真实性差距

Kawin Ethayarajh, Dan Jurafsky

AI总结 该研究发现NLG评估的标准人工评分协议存在真实性差距,因隐含假设被违反导致无法准确反映人类偏好,提出适用于开放式任务的SPA协议,且SPA能更准确恢复GPT-3模型的排序。

Comments EMNLP 2022

详情

展开后加载摘要…

URL PDF HTML 收藏