arXivDaily arXiv每日学术速递 周一至周五更新

作者

Graham Neubig

Natural Language Processing

2025-12-01 至 2025-12-01 共收录 1
2511.22173 2025-12-01 cs.CL

RefineBench: Evaluating Refinement Capability of Language Models via Checklists

RefineBench: 通过检查表评估语言模型的细化能力

Young-Jun Lee, Seungone Kim, Byung-Kwan Lee, Minkyeong Moon, Yechan Hwang, Jong Myoung Kim, Graham Neubig, Sean Welleck, Ho-Jin Choi

机构 * KAIST(韩国科学技术院) Carnegie Mellon University(卡内基梅隆大学) NVIDIA(英伟达) Independent Researcher(独立研究者)

AI总结 RefineBench通过检查表评估语言模型的细化能力,发现指导细化能显著提升响应质量,而自我细化则需进一步突破。

Comments Project website: https://passing2961.github.io/refinebench-page/

详情

展开后加载摘要…

URL PDF HTML 收藏