机构
*
Griffith University(格里菲斯大学)
;
Jiangsu University(江苏大学)
;
University of Southern Queensland(南方昆士兰大学)
;
Peking University(北京大学)
;
Great Bay University(大湾大学)
;
Nanjing University(南京大学)
;
Macquarie University(麦觉瑞大学)
;
Southern University of Science and Technology(南方科学与技术大学)
专题命中
评测与基准
:LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI
From Benchmarks to Skills: Low-Rank Factors for LLM Evaluation
从基准到技能:LLM评估的低秩因子
Aviya Maimon, Amir DN Cohen, Gal Vishne, Shauli Ravfogel, Reut Tsarfaty
机构
*
Bar-Ilan University(巴伊兰大学)
;
OriginAI
;
Data Science Institute Columbia University(哥伦比亚大学数据科学学院)
;
Center for Data Science New York University(纽约大学数据科学中心)
专题命中
评测与基准
:LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL
机构
*
University of California, Berkeley(加州大学伯克利分校)
;
The Chinese University of Hong Kong(香港中文大学)
;
New York University(纽约大学)
;
The University of Hong Kong(香港大学)
专题命中
评测与基准
:LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI
机构
*
School of Computing, Informatics Institute of Technology(计算学院,信息学院技术研究所)
;
School of Mathematics and Computer Science, Swansea University(数学与计算机科学学院,萨默塞特大学)
;
R&D, Zame AI(Zame AI研发部)
专题命中
评测与基准
:language model(title,abstract);small language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract)
Mathematical Reasoning in Large Language Models: Benchmarks, Architectures, Evaluation, and Open Challenges
大型语言模型中的数学推理:基准测试、架构、评估与开放挑战
Husnain Amjad, Raja Khurram Shahzad, Aamir Shahzad, Mehwish Fatima
机构
*
organization= School of Electrical Engineering
;
Computer Science, National University of Science
;
organization= School of Computing, Data
;
Mathematical Sciences, Western Sydney University, Indonesia
;
organization= Department of Communication, Quality Management
;
Information Systems, Mid Sweden University, Östersund Campus, Sweden
专题命中
评测与基准
:large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);pretraining(abstract)
PerFACT: Motion Policy with LLM-Powered Dataset Synthesis and Fusion Action-Chunking Transformers
PerFACT: 基于LLM驱动的数据集合成与融合动作分块变换器的运动策略
Davood Soleymanzadeh, Xiao Liang, Minghui Zheng
机构
*
J. Mike Walker ’66 Department of Mechanical Engineering, Texas A&M University(J. Mike Walker ’66机械工程系,德克萨斯A&M大学)
;
Zachry Department of Civil and Environmental Engineering, Texas A&M University(Zachry土木与环境工程系,德克萨斯A&M大学)
专题命中
评测与基准
:LLM(title,title_cn);large language model(abstract);language model(abstract)
Are LLM Evaluators Really Narcissists? Sanity Checking Self-Preference Evaluations
LLM评估者真的是自恋者吗?对自我偏好评估的健全性检查
Dani Roytburg, Matthew Bozoukov, Matthew Nguyen, Jou Barzdukas, Mackenzie Puig-Hall, Narmeen Oozeer
机构
*
Department of Machine Learning, Carnegie Mellon University, Pittsburgh, PA, USA(卡内基梅隆大学机器学习系)
;
Department of Computer Science and Engineering, University of California San Diego, La Jolla, CA, USA(加州大学圣地亚哥分校计算机科学与工程系)
;
Department of Computer Science, University of Virginia, Charlottesville, VA, USA(弗吉尼亚大学计算机科学系)
;
Martian Research, San Francisco, California, USA(火星研究公司)
;
Apart Research, San Francisco, California, USA(Apart研究公司)
专题命中
评测与基准
:LLM(title,title_cn);large language model(abstract);language model(abstract);post-training(abstract)
Lost in Historical Time? A Polish History Matura Benchmark for Large Language Models
大语言模型通过了历史考试却遗漏了《历史》:波兰高中毕业考试Matura基准测试
Adrian Trzoss, Kacper Dudzic, Wiktor Werner, Marcin Moskalewicz
机构
*
Adam Mickiewicz University(亚当·密茨凯维奇大学)
;
IDEAS Research Institute(IDEAS研究院)
;
AMU Center for Artificial Intelligence(亚当·密茨凯维奇大学人工智能中心)
;
Poznań University of Medical Sciences(波兹南医科大学)
;
Maria Curie-Skłodowska University(玛丽·居里-斯克洛多夫斯卡大学)
;
WSB Merito University(WSB梅里托大学)
专题命中
评测与基准
:LLM(summary_cn,abstract);language model(title,abstract);large language model(title);分类 cs.CL