Empirical Evaluation of Out-Of-Distribution Performance of Tabular Foundation Models
表格基础模型的分布外性能实证评估
Malena Loza, David Chushig-Muzo, Eva Milara, Luis Bote-Curiel, Luis Estrada-Petrocelli, Felipe Grijalva
机构
*
Colegio de Ciencias e Ingenierías, Universidad San Francisco de Quito (USFQ)(基多圣弗朗西斯科大学科学与工程学院)
;
Rey Juan Carlos University(胡安·卡洛斯国王大学)
;
Facultad de Ingeniería, Universidad Latina de Panamá(巴拿马拉丁大学工程学院)
Coresets Before Score Sets: Evaluation-Unsupervised Prompt Subset Selection for LLM Benchmarks
分数集之前的核心集:用于大语言模型基准测试的评估无监督提示子集选择
Jihan Yao, Gantavya Bhatt, Arnav Das, Peter Jin, Ke Bao, Qiaolin Yu, Khushi Bhardwaj, Chang Su, Jialei Wang, Yikai Zhu, Sugam Devare, Damon Mosk-Aoyama, Zhen Dong, Venkat Krishna Srinivasan, Yineng Zhang, Oleksii Kuchaiev, Jiantao Jiao, Banghua Zhu, Jeff Bilmes
机构
*
University of Washington(华盛顿大学)
;
University of California, Berkeley(加利福尼亚大学伯克利分校)
;
Oracle(甲骨文公司)
;
Together AI(Together AI公司)
;
LMSYS
;
NVIDIA(英伟达公司)
Omni-Sleep: A Sleep Foundation Model via Hierarchical Contrastive Learning of CNS-ANS Dynamics
全睡眠:一种通过中枢神经系统-自主神经系统动态分层对比学习的睡眠基础模型
Zhoujie Hou, Song Wang, Kexin Lou, Mo Wang, Chen Wei, Quanying Liu
机构
*
Department of Biomedical Engineering, Southern University of Science and Technology(南方科技大学生物医学工程系)
;
Omni-Intelligence(全知智能)
;
Shenzhen Loop Area Institute(深圳河套学院)
机构
*
IBM Automation and AI(IBM自动化与人工智能)
;
Hother(霍瑟)
;
University of Warsaw(华沙大学)
;
Centre for Credible AI, Warsaw University of Technology(华沙理工大学可信人工智能中心)
When the Judge Changes, So Does the Measurement: Auditing LLM-as-Judge Reliability
当评判者改变时,测量结果也会改变:评估大语言模型作为评判者的可靠性
Zongyou Yang, Yinghan Hou, Xiaokun Yang
机构
*
Dyson School of Design Engineering, Imperial College London(伦敦帝国理工学院戴森设计工程学院)
;
Department of Electrical and Electronic Engineering, Imperial College London(伦敦帝国理工学院电气与电子工程系)
;
School of Electronic Information, Nanchang Institute of Technology(南昌工程学院电子信息学院)
机构
*
Department of Computer Applications in Science \& Engineering, BARCELONA Supercomputing Center, 08034 Barcelona, Spain Escuela Técnica Superior de Ingeniería (ICAI), Universidad Pontificia Comillas, 28015 Madrid, Spain Human Centered AI, Data \& Software, LUXEMBOURG Institute of Science
CommentsAccepted as a book chapter in "Advances in Global Applied Artificial Intelligence" (G. A. Tsihrintzis, M. Virvou, N. G. Bourbakis, L. C. Jain, Eds.), authenticated version will be published in Springer series: Learning and Analytics in Intelligent Systems
A harmonised dataset for Earth system foundation models
用于地球系统基础模型的统一数据集
Carlos Rodriguez-Pardo, Massimo Tavoni
机构
*
Politecnico di Milano, Department of Management, Economics and Industrial Engineering(米兰理工大学管理、经济与工业工程系)
;
RFF-CMCC European Institute on Economics and the Environment(资源未来研究所-欧洲经济与环境CMCC研究所)
;
CMCC Foundation - Euro-Mediterranean Center on Climate Change(CMCC基金会-欧洲地中海气候变化中心)
Scaling Generative Foundation Models for Chest Radiography with Rectified Flow Transformers
使用整流流变换器扩展胸部X光片的生成式基础模型
Fabio De Sousa Ribeiro, Emma A. M. Stanley, Charles Jones, Tian Xia, Dominic C. Marshall, Laurent Renard Triché, Christopher V. Cosgriff, Panagiotis Dimitrakopoulos, Sotirios A. Tsaftaris, Ben Glocker
机构
*
Imperial College London(帝国理工学院)
;
Causality in Healthcare AI Hub(医疗AI因果关系中心)
;
University of Edinburgh(爱丁堡大学)
;
Cleveland Clinic London(克利夫兰诊所伦敦)
;
Department of Perioperative Medicine, CHU Clermont-Ferrand(克莱蒙费朗大学医院围手术期医学科)
;
Department of Medicine, Massachusetts General Hospital(麻省总医院医学部)
;
Broad Institute of MIT and Harvard(麻省理工学院与哈佛大学博德研究所)