SimBench: Benchmarking the Ability of Large Language Models to Simulate Human Behaviors
SimBench:大型语言模型模拟人类行为能力的基准测试
机构 * University of Cambridge(剑桥大学) ; Stanford University(斯坦福大学) ; Bocconi University(博科尼大学) ; University of Oxford(牛津大学)
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY
AI总结 SimBench通过统一20个多样化的数据集,评估大型语言模型模拟人类行为的 fidelity,发现模型性能与模型大小呈对数线性关系,但与计算资源无关,且存在指令微调与模拟准确性之间的权衡。
Comments Accepted at ICLR 2026. Project Website: http://simbench.tiancheng.hu/ Data: https://huggingface.co/datasets/pitehu/SimBench