HOLMES: Evaluating Higher-Order Logical Reasoning in LLMs
HOLMES: 评估大语言模型中的高阶逻辑推理
机构 * State Key Laboratory of Multimedia Information Processing, Peking University(北京大学多媒体信息处理国家重点实验室) ; School of Computer Science, Peking University(北京大学计算机科学学院) ; Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) ; Beijing Academy of Artificial Intelligence(北京智源人工智能研究院) ; School of Computing, National University of Singapore(新加坡国立大学计算机学院) ; YiXin-AILab, YIXIN(YiXin-AILab,YIXIN)
专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(title,abstract);分类 cs.AI
AI总结 提出HOLMES基准,基于高阶逻辑评估LLM在规则、谓词和约束上的推理能力,发现当前模型平均准确率仅50.64%,揭示高阶符号推理是关键瓶颈。