LLM CHESS: Benchmarking Reasoning and Instruction-Following in LLMs through Chess
LLM CHESS: 通过国际象棋评估大语言模型的推理与指令遵循能力
机构 * UC Berkeley(加州大学伯克利分校) ; Independent Researcher(独立研究者) ; UC Santa Cruz(加州大学圣克鲁兹分校) ; Stanford University(斯坦福大学) ; Google DeepMind(谷歌DeepMind)
AI总结 LLM CHESS通过国际象棋评估大语言模型的推理与指令遵循能力,揭示了推理模型与非推理模型的显著差异,并提供了评估框架和公开排行榜。