EduArt: An educational-level benchmark for evaluating art history knowledge in large language models
EduArt:评估大型语言模型艺术史知识的教育级基准
Gianmarco Spinaci, Lukas Klic, Giovanni Colavizza
机构
*
University of Bologna(博洛尼亚大学)
;
Villa i Tatti – The Harvard University Center for Italian Renaissance Studies(哈佛大学意大利文艺复兴研究中心(I Tatti))
;
University of Copenhagen(哥本哈根大学)
专题命中
评测与基准
:large language model(title,abstract);language model(title,abstract);分类 cs.CL
SrDetection: A Self-Referential Framework for Data Leakage Detection in Code Large Language Models
SrDetection: 一种用于代码大型语言模型中数据泄露检测的自参考框架
Shuaimin Li, Liyang Fan, Zeyang Li, Zhuoyue Wan, Yufang Lin, Shiwen Ni, Feiteng Fang, Hamid Alinejad-Rokny, Yuanfeng Song, Kun Jing, Chen Jason Zhang, Min Yang
机构
*
Shenzhen Key Laboratory for High Performance Data Mining(深圳高性能数据挖掘重点实验室)
;
Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院,中国科学院)
;
Shenzhen University(深圳大学)
;
University of Science and Technology of China(中国科学技术大学)
;
PolyU(香港理工大学)
;
East China Normal University(华东师范大学)
;
Artificial Intelligence Research Institute, Shenzhen University of Advanced Technology(深圳大学先进技术研究院人工智能研究所)
;
University of New South Wales(新南威尔士大学)
;
Anhui University(安徽大学)
专题命中
评测与基准
:large language model(title,abstract);language model(title,abstract);分类 cs.CL
Business as Rulesual: A Benchmark and Framework for Business Rule Flow Modeling with LLMs
业务即规则:面向LLM的业务规则流建模基准与框架
Chen Yang, Ruping Xu, Ruizhe Li, Bin Cao, Jing Fan
机构
*
Zhejiang University of Technology(浙江工业大学)
;
Zhejiang Key Laboratory of Visual Information Intelligent Processing(浙江省视觉信息智能处理重点实验室)
;
University of Aberdeen(阿伯丁大学)
;
University of Birmingham(伯明翰大学)
专题命中
评测与基准
:LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);prompting(abstract)
A Systematic Evaluation of Black-Box Uncertainty Estimation Methods for Large Language Models
大型语言模型黑盒不确定性估计方法的系统评估
Jiayi Wang, Xu-Yao Zhang
机构
*
State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所多模态人工智能系统国家重点实验室)
专题命中
评测与基准
:large language model(title,abstract);language model(title,abstract);分类 cs.AI
Large Language Models for Agentic NetOps and AIOps: Architectures, Evaluation, and Safety
用于代理网络运维和AI运维的大型语言模型:架构、评估与安全
Muhammad Bilal, Jon Crowcroft, Ruizhi Wang, Xiaolong Xu, Schahram Dustdar
机构
*
School of Computing and Communications(计算与通信学院)
;
University of Cambridge(剑桥大学)
;
School of Software(软件学院)
;
Nanjing University of Information Science and Technology(南京信息科技大學)
;
TU Wien(维也纳技术大学)
;
ICREA
专题命中
评测与基准
:large language model(title,abstract);language model(title,abstract);分类 cs.AI
Ido Aharon, Emanuele La Malfa, Michael Wooldridge, Sarit Kraus
机构
*
Department of Computer Science, Bar-Ilan University(巴伊兰大学计算机科学系)
;
Department of Computer Science, University of Oxford(牛津大学计算机科学系)
;
Institute for Decentralized AI (IDAI)(去中心化人工智能研究所)
专题命中
评测与基准
:large language model(title,abstract);language model(title,abstract);分类 cs.LG
UrbanWell: Benchmarking Multimodal Large Language Models for Spatio-Temporal Urban Wellbeing Analytics
UrbanWell: 面向时空城市福祉分析的多模态大语言模型基准测试
Yanxin Xi, Xiang Su, Jie Feng, Yu Liu, Sasu Tarkoma, Pan Hui
机构
*
University of Helsinki(赫尔辛基大学)
;
Zhongguancun Academy(中关村学院)
;
University of Oxford(牛津大学)
;
Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
专题命中
评测与基准
:large language model(title,abstract);language model(title,abstract);分类 cs.AI
Mapping Geopolitical Bias in 11 Large Language Models: A Bilingual, Dual-Framing Analysis of U.S.-China Tensions
映射11个大语言模型中的地缘政治偏见:美中紧张局势的双语、双框架分析
William Guey, Wei Zhang, Pierrick Bougault, Vitor D. de Moura, José O. Gomes
机构
*
Department of Industrial Engineering, Tsinghua University(清华大学工业工程系)
;
School of Social Sciences, Tsinghua University(清华大学社会科学部)
;
Department of Industrial Engineering, Federal University of Rio de Janeiro(里约热内卢联邦大学工业工程系)
专题命中
评测与基准
:large language model(title,abstract);language model(title,abstract);分类 cs.CL
Constrained Semantic Decompression in LLMs through Persian Proverb-Conditioned Story Generation
通过波斯谚语条件故事生成实现LLM中的约束语义解压缩
Zahra Habibzadeh, Paria Khoshtab, Amir Mesbah, Yadollah Yaghoobzadeh
机构
*
Tehran Institute for Advanced Studies, Khatam University, Iran(德黑兰高级研究所,卡塔姆大学,伊朗)
;
School of Electrical and Computer Engineering, College of Engineering, University of Tehran, Tehran, Iran(电气与计算机工程学院,工程学院,德黑兰大学,伊朗)
专题命中
评测与基准
:LLM(title_cn,abstract);large language model(abstract);language model(abstract);prompting(abstract)
机构
*
Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学首都人工智能学院)
;
Tongyi Lab(通义实验室)
;
Institute of Statistics and Big Data, Renmin University of China(中国人民大学统计与大数据研究院)
专题命中
评测与基准
:large language model(title,abstract);language model(title,abstract);分类 cs.CL
机构
*
AnnLab(安实验室)
;
Institute of Semiconductors, Chinese Academy of Sciences(中国科学院半导体研究所)
;
Zhongguancun Academy(中关村学院)
;
State Key Laboratory of Multimodal Artificial Intelligence Systems(多模态人工智能系统国家重点实验室)
;
State Key Laboratory of High Performance Ceramics(高性能陶瓷国家重点实验室)
;
University of Chinese Academy of Sciences(中国科学院大学)
;
School of Electronic, Electrical and Communication Engineering(电子电气与通信工程学院)
;
University of ChineseAcademy of Sciences(中国科学院大学)
专题命中
评测与基准
:large language model(title,abstract);language model(title,abstract);分类 cs.AI
Phase transition in large language models and the criticality of natural languages
大型语言模型中的相变与自然语言的临界性
Kai Nakaishi, Yoshihiko Nishikawa, Koji Hukushima
机构
*
Center for Advanced Intelligence Project, RIKEN(先进智能项目中心,理化学研究所)
;
National Institute for Japanese Language and Linguistics(日本语言学研究所)
;
Department of Physics, Nagoya University(名古屋大学物理系)
;
Department of Multidisciplinary Sciences, The University of Tokyo(东京大学多学科科学系)
;
Komaba Institute for Science, The University of Tokyo(东京大学Komaba科学研究所)
专题命中
评测与基准
:large language model(title,abstract);language model(title,abstract);分类 cs.LG