Auditing the Audit: Five Failure Modes in Benchmark-Validity Audits
审核审核:基准有效性审核中的五种失败模式
Yanhang Li, Zhichao Fan, Zexin Zhuang
机构
*
European Parliament and Council(欧洲议会和理事会)
;
National Institute of Standards and Technology(美国国家标准与技术研究院)
;
State Administration for Market Regulation and Standardization Administration of China(中国国家市场监督管理总局和中国国家标准化管理委员会)
Zhiyue Xu, Fandi Meng, Kaijie Xu, Clark Verbrugge, Simon Lucas, Jian Zhao
机构
*
Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
;
Zhongguancun Academy(中关村学院)
;
Zhongguancun Institute of Artificial Intelligence(中关村人工智能研究所)
;
School of Computer Science, McGill University, Montreal, Quebec, Canada(麦吉尔大学计算机科学学院)
;
Game AI Research Group, Queen Mary University of London, London, United Kingdom(伦敦女王学院游戏人工智能研究组)
机构
*
South China University of Technology(华南理工大学)
;
The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
;
Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))
Could Large Language Models work as Post-hoc Explainability Tools in Credit Risk Models?
大语言模型能否在信用风险模型中作为事后可解释性工具?
Wenxi Geng, Dingyuan Liu, Liya Li, Yiqing Wang
机构
*
University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)
;
Georgia Institute of Technology(佐治亚理工学院)
;
Southern Methodist University(南方 Methodist 大学)
One Prompt, Many Sounds: Modeling Listener Variability in LLM-Based Equalization
一个提示,多种声音:在基于大语言模型的均衡中建模听众差异
Ioannis Stylianou, Jon Francombe, Pablo Martinez-Nuevo, Sven Ewan Shepstone, Zheng-Hua Tan
机构
*
Bang & Olufsen A/S, Struer, Denmark(丹麦Bang & Olufsen A/S公司,Struer)
;
Department of Electronic Systems, Aalborg University(奥胡斯大学电子系统系)
;
Pioneer Centre for AI, Copenhagen, Denmark(哥本哈根先锋人工智能中心)
机构
*
Independent Researcher(独立研究者)
;
Hunan University(湖南大学)
;
Shenzhen Kaihong Digital Industry Development Co., Ltd.(深圳凯鸿数字产业开发有限公司)
;
Central University of Finance and Economics(中央财经大学)
;
Chongqing University(重庆大学)
;
Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
;
Stevens Institute of Technology(斯蒂文斯理工学院)
;
Cornell University(康奈尔大学)
;
Oak Ridge National Laboratory(橡树岭国家实验室)
;
Zhengzhou University of Light Industry(郑州轻工业大学)
;
Xidian University(西安电子科技大学)
;
The University of Texas at Dallas(德克萨斯大学达拉斯分校)
;
AI Safety Research Lab, Institute of Advanced Computing(高级计算研究所人工智能安全研究实验室)
;
University of Malaya(马来亚大学)
;
Emory University(埃默里大学)
;
Department of Nephrology, Affiliated Hospital of Guangdong Medical University(广东医学院附属医院肾内科)
Distribution-free Deviation Bounds and The Role of Domain Knowledge in Learning via Model Selection with Cross-validation Risk Estimation
无分布偏差界以及领域知识在通过交叉验证风险估计进行模型选择学习中的作用
Diego Marcondes, Cláudia Peixoto
机构
*
Mathematical Sciences Institute and France-Australia Mathematical Sciences and Interactions ANU-CNRS International Research Lab(数学科学研究所和法澳数学科学与互动ANU-CNRS国际研究实验室)
;
Department of Applied Mathematics, Institute of Mathematics and Statistics, Universidade de São Paulo(应用数学系、数学与统计研究所、圣保罗大学)
Efficient Waste Sorting for Circular Economy: A Confidence-guided comparison between One-Vs-All and One-Vs-Rest Classification Strategies with Human-in-the-Loop for Automated Waste Sorting
面向循环经济的高效废物分类:基于置信度的人机协同自动废物分类中一对多与一对一分类策略比较
Mohammed Fahad Ali, Dominique Briechle, Marit Briechle-Mathiszig, Tobias Geger, Andreas Rausch
机构
*
Institute for Software and Systems Engineering(软件与系统工程研究所)
;
Clausthal University of Technology(克莱斯特哈根技术大学)
Multilayer Q-Matrix-Embedded Neural Network for Cognitive Diagnosis (M-QCDNet): Structure-Aware Deep Learning Architecture for Psychometric Interpretability
A Unified Framework for the Evaluation of LLM Agentic Capabilities
LLM 代理能力评估的统一框架
Pengyu Zhu, Lijun Li, Yaxing Lyu, Qianxin Luo, Jingyi Yang, Yi Liu, Tingfeng Hui, Xinyu Yuan, Li Sun, Sen Su, Jing Shao
机构
*
Beijing University of Posts and Telecommunications(北京邮电大学)
;
Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
;
Chongqing University of Posts and Telecommunications(重庆邮电大学)
;
North China Electric Power University(华北电力大学)