ChessArena: A Chess Testbed for Evaluating Strategic Reasoning Capabilities of Large Language Models
ChessArena: 一个用于评估大语言模型战略推理能力的国际象棋测试平台
机构 * State Key Laboratory of Novel Software Technology(新型软件技术国家重点实验室) ; Baidu(百度) ; University of Electronic Science and Technology of China(电子科技大学)
AI总结 本文提出ChessArena测试平台,用于评估大语言模型的战略推理能力,测试了13个模型在800多局游戏中表现,发现无模型能击败业余水平的Maia-1100,但经过微调的Qwen3-8B模型表现显著提升。