Benchmarking LLM Judges for Mobile Agent Evaluation
面向移动智能体评估的LLM评判基准测试
Ziqiang Wang, Li Gu, Zhixiang Chi, Zhi Liu, Seyed Mehdi Ayyoubzadeh, Yuanhao Yu, Yang Wang
机构
*
Mila – Québec AI Institute(米拉-魁北克人工智能研究所)
;
Concordia University(康考迪亚大学)
;
University of Toronto(多伦多大学)
;
Shanghai University(上海大学)
;
McMaster University(麦克马斯特大学)
机构
*
Department of Mechanical Engineering, University of Michigan, Ann Arbor, Michigan, USA(机械工程系,密歇根大学,安阿伯,密歇根州,美国)
;
Max-Planck-Institute for Sustainable Materials, Materials Informatics, Düsseldorf, Germany(可持续材料研究所,材料信息学,杜塞尔多夫,德国)
;
Mechanical Engineering, University of Michigan, Ann Arbor, Michigan, USA(机械工程,密歇根大学,安阿伯,密歇根州,美国)
专题命中
评测与基准
:LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI