2510.08697
2025-12-19
cs.SE
cs.AI
cs.CL
BigCodeArena: Unveiling More Reliable Human Preferences in Code Generation via Execution
BigCodeArena: 通过执行揭示更多可靠的代码生成人类偏好
Terry Yue Zhuo, Xiaolong Jin, Hange Liu, Juyong Jiang, Tianyang Liu, Chen Gong, Bhupesh Bishnoi, Vaisakhi Mishra, Marek Suppa, Noah Ziems, Saiteja Utpala, Ming Xu, Guangyu Song, Kaixin Li, Yuhan Cao, Bo Liu, Zheng Liu, Sabina Abdurakhmanova, Wenhao Yu, Mengzhao Jia, Jihan Yao, Kenneth Hamilton, Kumar Shridhar, Minh Chien Vu, Dingmin Wang, Jiawei Liu, Zijian Wang, Qian Liu, Binyuan Hui, Meg Risdal, Ahsen Khaliq, Atin Sood, Zhenchang Xing, Wasi Uddin Ahmad, John Grundy, David Lo, Banghua Zhu, Xiaoning Du, Torsten Scholak, Leandro von Werra
机构
*
Monash University(墨尔本大学)
;
CSIRO’s Data61(CSIRO的数据61)
;
Purdue University(普渡大学)
;
Independent(独立)
;
HKUST (Guangzhou)(香港科技大学(广州))
;
UCSD(加州大学圣地亚哥分校)
;
UVA(弗吉尼亚大学)
;
CNRS, France(法国国家科学研究中心)
;
IBM
;
Cisco(思科)
;
Comenius University in Bratislava(布拉提斯拉瓦康门纽斯大学)
;
University of Notre Dame(Notre Dame大学)
;
Uber
;
Tano Labs(Tano实验室)
;
NUS(国立大学新加坡)
;
Institute of Automation, CAS(中国科学院自动化研究所)
;
Tencent AI Lab(腾讯AI实验室)
;
University of Washington(华盛顿大学)
;
Nevsky Collective(Nevsky集体)
;
ETH Zurich(苏黎世联邦理工学院)
;
Detomo Inc(Detomo公司)
;
University of Oxford(牛津大学)
;
UIUC(伊利诺伊大学香槟分校)
;
Google(谷歌)
;
NVIDIA
;
Singapore Management University(新加坡管理学院)
;
ServiceNow Research(ServiceNow研究)
;
Hugging Face
纠错
AI总结
BigCodeArena通过执行揭示更多可靠的代码生成人类偏好,提出自动评分基准评估LLM编码质量。