RankLLM: Weighted Ranking of LLMs by Quantifying Question Difficulty
RankLLM: 通过量化问题难度对大型语言模型进行加权排名
Ziqian Zhang, Xingjian Hu, Yue Huang, Kai Zhang, Ruoxi Chen, Yixin Liu, Qingsong Wen, Kaidi Xu, Xiangliang Zhang, Neil Zhenqiang Gong, Lichao Sun
机构
*
Lehigh University(莱维大学)
;
University of Notre Dame(诺特大学)
;
Zhejiang Wanli University(浙江万里大学)
;
Squirrel Ai Learning
;
City University of Hong Kong(香港城市大学)
;
Duke University(杜克大学)
专题命中
评测与基准
:LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
Conditional Vendi Score: Prompt-Aware Diversity Evaluation for Generative AI Models and LLMs
条件 Vendi 分数:生成式 AI 模型和 LLM 的提示感知多样性评估
Mohammad Jalali, Azim Ospanov, Amin Gohari, Farzan Farnia
机构
*
Department of Computer Science and Engineering, The Chinese University of Hong Kong(计算机科学与工程系,香港中文大学)
;
Department of Information Engineering, The Chinese University of Hong Kong(信息工程系,香港中文大学)
专题命中
评测与基准
:LLM(title_cn,abstract);分类 cs.AI、cs.LG
AI总结
针对文本提示引导的生成模型,提出条件 Vendi 和条件 RKE 分数,通过条件熵分离模型自身多样性,并证明收敛性及在多个任务中恢复真实多样性排序。
机构
*
Northeastern University(东北大学)
;
University of Notre Dame(Notre Dame 大学)
;
University of Waterloo(滑铁卢大学)
;
Carnegie Mellon University(卡内基梅隆大学)
;
Adobe(Adobe公司)
;
Microsoft Research Asia(微软亚洲研究院)
机构
*
The Hong Kong University of Science(香港科学与技术大学)
;
Inner Mongolia University(内蒙古大学)
;
Beihang University(北京航空航天大学)
;
Queen Mary University of London(伦敦玛丽女王大学)
;
The Chinese University of Hong Kong(香港中文大学)
;
National University of Singapore(新加坡国立大学)
;
University of Surrey(萨里大学)
;
University of Rochester(罗切斯特大学)
;
Independent Researcher(独立研究者)
专题命中
评测与基准
:LLM(abstract_cn);large language model(abstract);language model(abstract);instruction tuning(abstract)
机构
*
Northeastern University, Boston, MA, USA
;
The Chinese University of Hong Kong, Hong Kong, China
;
Peking University, Beijing, China
;
Westlake University, Hangzhou, China
;
Harvard University, Cambridge, MA, USA
;
Purdue University, West Lafayette, IN, USA
;
University of Oxford, Oxford, United Kingdom
专题命中
评测与基准
:language model(title,abstract);large language model(abstract)
机构
*
Graduate School of Agricultural and Life Sciences, The University of Tokyo(东京大学大学院农学生命科学研究科)
;
National Key Laboratory of Multispectral Information Intelligent Processing Technology, School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(华中科技大学多谱信息智能处理技术全国重点实验室、人工智能与自动化学院)
;
Institute of Agricultural Machinery, NARO(日本国立研究开发法人农业·食品产业技术综合研究机构农业机械研究所)
;
Institute of Life and Environmental Sciences, University of Tsukuba(筑波大学生命环境科学研究所)
Ensemble learning of pathology foundation models for precision oncology
面向精准肿瘤学的病理基础模型集成学习
Xiangde Luo, Xiyue Wang, Feyisope Eweje, Xiaoming Zhang, Juan Luis Gomez Marti, Sarah Cascarino, Sen Yang, Yuchen Li, Ryan Quinton, Jinxi Xiang, Yuanfeng Ji, Zhe Li, Yijiang Chen, Colin Bergstrom, Ted Kim, Francesca Maria Olguin, Kelley Yuan, Matthew Abikenari, Andrew Heider, Sierra Willens, Sanjeeth Rajaram, Robert West, Joel Neal, Adam Schoenfeld, Maximilian Diehn, Chad Vanderbilt, Ruijiang Li
机构
*
Department of Radiation Oncology, Stanford University School of Medicine(放射肿瘤科,斯坦福大学医学院)
;
Department of Pathology, Stanford University School of Medicine(病理学系,斯坦福大学医学院)
;
Department of Medicine (Oncology), Stanford University School of Medicine(医学系(肿瘤学),斯坦福大学医学院)
;
Department of Neurosurgery, Stanford University School of Medicine(神经外科,斯坦福大学医学院)
;
Stanford Institute for Human-Centered Artificial Intelligence(斯坦福大学人本人工智能研究所)
A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook
大型音频语言模型综述:通用性、可信度与展望
Kaiwen Luo, Zhenhong Zhou, Leyan Wang, Liang Lin, Tianyu Shao, Yuanhe Zhang, Yang Xiao, Yuxuan Li, Miao Yu, Kailin Lyu, Jiaming Zhang, Li Sun, Songze Li, Yueming Wu, Ting Dang, Xiaojun Jia, Dongrui Liu, Kai Li, Rohan Kumar Das, Siyuan Liang, Xinfeng Li, Qiankun Li, Jing Chen, Xingjun Ma, Kun Wang, Junhao Dong, Deqing Zou, Yu Cheng, Xia Hu, Zhigang Zeng, Sen Su, Yang Liu, Yu-Gang Jiang, Philip S. Yu, Yew-Soon Ong
机构
*
Nanyang Technological University(南洋理工大学)
;
Independent Researcher(独立研究者)
;
The University of Melbourne(墨尔本大学)
;
North China Electric Power University(华北电力大学)
;
Beijing University of Posts and Telecommunications(北京邮电大学)
;
University of Chinese Academy of Sciences(中国科学院大学)
;
University of Science and Technology of China(中国科学技术大学)
;
Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
;
Shanghai AI Laboratory(上海人工智能实验室)
;
Huazhong University of Science and Technology(华中科技大学)
;
Tsinghua University(清华大学)
;
Fortemedia Singapore(富媒体新加坡)
;
Tencent(腾讯)
;
Fudan University(复旦大学)
;
Wuhan University(武汉大学)
;
Chinese University of Hong Kong(香港中文大学)
;
Chongqing University of Posts and Telecommunications(重庆邮电大学)
;
University of Illinois Chicago(伊利诺伊大学芝加哥分校)
专题命中
评测与基准
:language model(title,abstract);large language model(abstract)
机构
*
Department of Pathology, Nanfang Hospital, Southern Medical University, Guangzhou, China(南方医科大学南芳医院病理科,广州,中国)
;
Department of Pathology, School of Basic Medical Sciences, Southern Medical University, Guangzhou, China(南方医科大学基础医学学院病理科,广州,中国)
;
Department of Computer Science and Engineering, Hong Kong University of Science and Technology, Hong Kong, China(香港科技大学计算机科学与工程系,香港,中国)
;
Guangdong Provincial Key Laboratory of Molecular Tumor Pathology, Guangzhou, China(广东省分子肿瘤病理重点实验室,广州,中国)
;
Department of Pathology, Shandong Provincial Qianfoshan Hospital, Jinan, Shandong, China(山东省青岛坊山医院病理科,济南,山东,中国)
SOCO: Benchmarking Semantic Object Correspondence in Vision Foundation Models
SOCO: 视觉基础模型中语义对象对应关系的基准测试
Olaf Dünkel, Basavaraj Sunagad, Haoran Wang, David T. Hoffmann, Christian Theobalt, Adam Kortylewski
机构
*
Max Planck Institute for Informatics(马克斯·普朗克研究所信息学研究所)
;
Saarland Informatics Campus(萨尔州信息学校园)
;
CISPA Helmholtz Center for Information Security(信息安全霍夫曼中心)
;
University of Freiburg(弗赖堡大学)
CommentsThis paper has been accepted for presentation at INTERSPEECH 2026 and as non-archival paper at ICML 2026 Workshop on Machine Learning for Audio
Is Vibe Coding Safe? Benchmarking Vulnerability of Agent-Generated Code in Real-World Tasks
Vibe 编程是否安全?在现实任务中对代理生成代码的漏洞基准测试
Songwen Zhao, Danqing Wang, Kexun Zhang, Jiaxuan Luo, Zhuo Li, Lei Li
机构
*
Carnegie Mellon University Language Technologies Institute(卡内基梅隆大学语言技术研究所)
;
Columbia University(哥伦比亚大学)
;
Johns Hopkins University(约翰霍普金斯大学)
;
HydroX AI
专题命中
评测与基准
:LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL