Coresets Before Score Sets: Evaluation-Unsupervised Prompt Subset Selection for LLM Benchmarks
分数集之前的核心集:用于大语言模型基准测试的评估无监督提示子集选择
机构 * University of Washington(华盛顿大学) ; University of California, Berkeley(加利福尼亚大学伯克利分校) ; Oracle(甲骨文公司) ; Together AI(Together AI公司) ; LMSYS ; NVIDIA(英伟达公司)
AI总结 研究大语言模型基准测试的核心集选择,采用评估无监督方法,利用次模子集选择,开发多种次模函数。在新大规模套件上实验发现设施选址函数效果好,该目标不限于特定模式,在相关排行榜上表现优且计算成本低,证明次模性对基准压缩有用。