PBBQ: A Persian Bias Benchmark Dataset Curated with Human-AI Collaboration for Large Language Models
Farhan Farsi, Shayan Bali, Fatemeh Valeh, Parsa Ghofrani, Alireza Pakniat, Kian Kashfipour, Amir H. Payberah
机构
*
Amirkabir University of Technology(阿米尔卡比尔技术大学)
;
King’s College London(伦敦国王学院)
;
Politecnico di Milano(米兰理工学院)
;
KTH Royal Institute of Technology(皇家理工学院)
专题命中
评测与基准
:large language model(title,abstract);language model(title,abstract);分类 cs.CL
Ever-Improving Test Suite by Leveraging Large Language Models
Ketai Qiu
专题命中
评测与基准
:large language model(title,abstract);language model(title,abstract)
CommentsAccepted by 33rd ACM International Conference on the Foundations of Software Engineering (FSE Companion '25), June 23--28, 2025, Trondheim, Norway
Journal refProceedings of the 33rd ACM International Conference on the Foundations of Software Engineering, 2025
PTFA: An LLM-based Agent that Facilitates Online Consensus Building through Parallel Thinking
Wen Gu, Zhaoxing Li, Jan Buermann, Jim Dilkes, Dimitris Michailidis, Shinobu Hasegawa, Vahid Yazdanpanah, Sebastian Stein
机构
*
Nagoya Institute of Technology(名古屋技术大学)
;
University of Southampton(南安普顿大学)
;
University of Amsterdam(阿姆斯特丹大学)
;
Japan Advanced Institute of Science and Technology(日本先进科学研究院)
专题命中
评测与基准
:LLM(title);large language model(abstract);language model(abstract);分类 cs.AI
Context-Aware Pseudo-Label Scoring for Zero-Shot Video Summarization
Yuanli Wu, Long Zhang, Yue Du, Bin Li
机构
*
Nanyang Technological University(南洋理工大学)
;
Guilin University of Electronic Technology(桂林电子科技大学)
;
Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院,中国科学院)
专题命中
评测与基准
:LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)
机构
*
Department of Electrical and Computer Engineering, University of Wisconsin-Madison, Madison, USA(威斯康星大学麦迪逊分校电子与计算机工程系)
;
Department of Computer Science, Banasthali Vidyapeeth, Rajasthan, India(班纳斯塔利大学计算机科学系)
;
Ansyst Consulting, Gurgaon, India(安西斯特咨询公司)
;
Huawei Ireland Research Center, Dublin, Ireland(华为爱尔兰研究中心)
;
Bradley Department of Electrical and Computer Engineering, Virginia Tech, Blacksburg, VA, USA(弗吉尼亚理工学院布拉德利电子与计算机工程系)
专题命中
评测与基准
:LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
Understanding the Implicit Biases of Design Choices for Time Series Foundation Models
Annan Yu, Danielle C. Maddix, Boran Han, Xiyuan Zhang, Abdul Fatir Ansari, Oleksandr Shchur, Christos Faloutsos, Andrew Gordon Wilson, Michael W. Mahoney, Yuyang Wang
机构
*
Center for Applied Mathematics(应用数学中心)
;
Cornell University(康奈尔大学)
;
Amazon Web Services(亚马逊网络服务)
;
Amazon Selling Partner Services(亚马逊销售合作伙伴服务)
;
Amazon Supply Chain Optimization Technologies(亚马逊供应链优化技术)
Integrating Transparent Models, LLMs, and Practitioner-in-the-Loop: A Case of Nonprofit Program Evaluation
Ji Ma, Albert Casella
机构
*
LBJ School of Public Affairs, The University of Texas at Austin(德克萨斯大学奥斯汀分校劳伦斯·伯克曼公共事务学院)
;
Gradel Institute of Charity, University of Oxford(牛津大学格拉德利慈善研究所)
;
Michael & Susan Dell Foundation(迈克尔与苏珊·德尔基金会)
专题命中
评测与基准
:LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
Can LLMs Correct Themselves? A Benchmark of Self-Correction in LLMs
Guiyao Tie, Zenghui Yuan, Zeli Zhao, Chaoran Hu, Tianhe Gu, Ruihang Zhang, Sizhe Zhang, Junran Wu, Xiaoyue Tu, Ming Jin, Qingsong Wen, Lixing Chen, Pan Zhou, Lichao Sun
机构
*
Huazhong University of Science and Technology(华中科技大学)
;
Griffith University(格里菲斯大学)
;
Squirrel Ai Learning(squirrel ai 学习)
;
Shanghai Jiaotong University(上海交通大学)
;
Lehigh University(莱斯大学)
专题命中
评测与基准
:LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
Measuring Data Science Automation: A Survey of Evaluation Tools for AI Assistants and Agents
Irene Testini, José Hernández-Orallo, Lorenzo Pacchiardi
机构
*
Leverhulme Centre for the Future of Intelligence, University of Cambridge, UK(未来智能研究中心、剑桥大学)
;
Valencian Research Institute for Artificial Intelligence (VRAIN), Universitat Politècnica de València, Spain(瓦伦西亚人工智能研究 institutes (VRAIN)、瓦伦西亚理工大学)
专题命中
评测与基准
:LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI