Nine Judges, Two Effective Votes: Correlated Errors Undermine LLM Evaluation Panels
九位评委,两张有效选票:相关错误削弱了LLM评估小组
机构 * Apple(苹果公司)
AI总结 本文通过分析9个前沿LLM在自然语言推理任务上的投票行为,发现由于模型间存在高度相关的错误,评估小组的有效信息仅相当于约2个独立投票,实际准确率比独立投票理想情况低8-22个百分点,且增加评委或改进聚合算法均无法弥补这一差距。
Comments 14 pages, 5 figures, 12 tables