arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Scale AI

2025-12-15 至 2025-12-15 共收录 1
2512.11183 2025-12-15 cs.LG

Progress over Points: Reframing LM Benchmarks Around Scientific Objectives

基于点的进展:围绕科学目标重新构建语言模型基准测试

Alwin Jin, Sean M. Hendryx, Vaskar Nath

机构 * Georgia Institute of Technology(佐治亚理工学院) Scale AI

AI总结 本文提出以科学目标为导向的语言模型基准测试环境,通过标准化数据集和训练框架,推动语言模型领域的科学进步。

详情

展开后加载摘要…

URL PDF HTML 收藏