Benchmarking LLMs for Political Science: A United Nations Perspective
对政治科学的LLM进行基准测试:一个联合国视角
机构 * Google Cloud AI Research(谷歌云人工智能研究)
专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.CL
AI总结 本文提出联合国基准(UNBench),用于评估LLMs在政治科学中的能力,涵盖联合国决策过程的三个阶段。
Comments This paper has been accepted at AAAI 2026 as an oral paper