Benchmark^2: Systematic Evaluation of LLM Benchmarks
Benchmark^2: 大语言模型评估基准的系统性评估
机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) ; Washington University in St. Louis(华盛顿大学圣路易斯分校) ; Xiaohongshu Inc.(小红书公司)
AI总结 Benchmark^2 提出了一种系统性评估大语言模型评估基准的方法,通过三个互补指标分析基准质量,揭示现有基准的差异并展示选择性构建的高效性。