Assessing Large Language Models for Medical QA: Zero-Shot and LLM-as-a-Judge Evaluation
评估大型语言模型用于医疗问答:零样本和LLM作为评判者评估
Shefayat E Shams Adib, Ahmed Alfey Sani, Ekramul Alam Esham, Ajwad Abrar, Tareque Mohmud Chowdhury
机构
*
Department of Computer Science and Engineering, Islamic University of Technology, Gazipur, Bangladesh(计算机科学与工程系,伊斯兰技术大学,加兹ipur,孟加拉国)
;
Department of Computer Science(计算机科学系)
;
Engineering, Islamic University of Technology, Gazipur, Bangladesh(工程,伊斯兰技术大学,加兹ipur,孟加拉国)
专题命中
评测与基准
:LLM(title,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL
机构
*
College of Civil Engineering, Tongji University(同济大学土木工程学院)
;
Shanghai Qi Zhi Institute(上海启智研究院)
;
Arcplus Group East China Architectural Design & Research Institute Co., Ltd.(Arcplus集团东部建筑设计与研究研究院有限公司)
;
College of Design and Innovation, Tongji University(同济大学设计与创新学院)
专题命中
评测与基准
:large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG
CommentsPaper accepted at the 19th Conference of the European Chapter of the Association for Computational Linguistics (EACL 2026), main conference. 21 pages
FGBench: A Dataset and Benchmark for Molecular Property Reasoning at Functional Group-Level in Large Language Models
FGBench: 一个用于大语言模型中功能基团级分子属性推理的数据集和基准
Xuan Liu, Siru Ouyang, Xianrui Zhong, Jiawei Han, Huimin Zhao
机构
*
Department of Chemical and Biomolecular Engineering, University of Illinois Urbana-Champaign(化学与生物分子工程系,伊利诺伊大学厄巴纳-香槟分校)
;
Department of Computer Science, University of Illinois Urbana-Champaign(计算机科学系,伊利诺伊大学厄巴纳-香槟分校)
专题命中
评测与基准
:large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG
Rubrics as an Attack Surface: Stealthy Preference Drift in LLM Judges
评分标准作为攻击面:LLM裁判中的隐蔽偏好漂移
Ruomeng Ding, Yifei Pang, He Sun, Yizhong Wang, Zhiwei Steven Wu, Zhun Deng
机构
*
University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)
;
Carnegie Mellon University(卡内基梅隆大学)
;
Yale University(耶鲁大学)
;
The University of Texas at Austin(德克萨斯大学奥斯汀分校)
专题命中
评测与基准
:LLM(title,abstract);large language model(abstract);language model(abstract);post-training(abstract)
CCiV: A Benchmark for Structure, Rhythm and Quality in LLM-Generated Chinese \textit{Ci} Poetry
CCiV: 一个用于评估LLM生成中文词诗结构、节奏和质量的基准
Shangqing Zhao, Yupei Ren, Yuhao Zhou, Xiaopeng Bai, Man Lan
机构
*
School of Computer Science and Technology, East China Normal University, China(东华师范大学计算机科学与技术学院)
;
Shanghai Institute of Artificial Intelligence for Education, East China Normal University, China(东华师范大学教育人工智能研究所)
;
Department of Chinese Language and Literature, East China Normal University, China(东华师范大学中文语言文学系)
专题命中
评测与基准
:LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)
机构
*
organization= School of Computer Science
;
Technology, Dalian University of Technology , addressline= No.2 Linggong Road, Ganjingzi District , city= Dalian , postcode= 116024 , country= China
;
organization= School of Information Engineering, Liaodong University , addressline= No.116 Linjiang Back Street, Zhenan District , city= Dandong , postcode= 118001 , country= China
;
organization= School of Information Engineering, Dalian Ocean University , addressline= No. 2-52, Heishijiao Street, Shahekou District , city= Dalian , postcode= 116023 , country= China
;
organization= Information Technology Center, Qinghai University , addressline= 251 Ningda Road, Chengbei District , city= Xining , postcode= 810016 , country= China
;
organization= School of Electronic
;
Information Engineering, Liaoning Technical University , addressline= 188 Longwan South Street, Sijiatun District , city= Huludao , postcode= 125105 , country= China
;
organization= School of Artificial Intelligence, Tianjin Normal University , addressline= 393 Binshui West Road, Xiqing District , city= Tianjin , postcode= 300387 , country= China
;
organization= Tencent (Dalian Northern Interactive Entertainment Technology Co., Ltd.) , addressline= 21/F, Tencent Building, No. 26 Jingxian St, Ganjingzi District , city= Dalian , postcode= 116085 , country= China
专题命中
评测与基准
:LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
Foundation Models in Autonomous Driving: A Survey on Scenario Generation and Scenario Analysis
自动驾驶中的基础模型:场景生成与场景分析的综述
Yuan Gao, Mattia Piccinini, Yuchen Zhang, Dingrui Wang, Korbinian Moller, Roberto Brusnicki, Baha Zarrouki, Alessio Gambi, Jan Frederik Totz, Kai Storms, Steven Peters, Andrea Stocco, Bassam Alrifaee, Marco Pavone, Johannes Betz
专题命中
评测与基准
:foundation model(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结
本文综述了基础模型在自动驾驶场景生成与分析中的应用,探讨了相关模型、方法及挑战。
CommentsIEEE Open Journal of Intelligent Transportation Systems
Journal refIEEE Open Journal of Intelligent Transportation Systems, 03 February 2026
机构
*
School of Computer Science, Peking University(北京大学计算机科学学院)
;
School of Software Engineering, South China University of Technology(华南理工大学软件学院)
;
Department of Computer Science, Yale University(耶鲁大学计算机科学系)
;
School of Psychological and Cognitive Sciences, Peking University(北京大学心理学与认知科学学院)
专题命中
评测与基准
:LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI
EIDOS: Latent-Space Predictive Learning for Time Series Foundation Models
EIDOS:用于时间序列基础模型的潜在空间预测学习
Xinxing Zhou, Qingren Yao, Yiji Zhao, Chenghao Liu, Flora Salim, Xiaojie Yuan, Yanlong Wen, Ming Jin
机构
*
Nankai University(南开大学)
;
Eindhoven University of Technology(埃因霍温理工大学)
;
Yunnan University(云南大学)
;
University of New South Wales(新南威尔士大学)
;
Griffith University(格里菲斯大学)
机构
*
Faculty of Data Science, City University of Macau(数据科学学院,澳门城市大学)
;
Key Laboratory of Computing Power Network and Information Security, Ministry of Education, Shandong Computer Science Center, Qilu University of Technology (Shandong Academy of Sciences)(计算能力网络与信息安全重点实验室,教育部,山东计算机科学中心,齐鲁工业大学(山东科学院))
;
Shandong Provincial Key Laboratory of Computing Power Internet and Service Computing, Shandong Fundamental Research Center for Computer Science(山东省计算能力互联网与服务计算重点实验室,山东省计算机科学基础研究中心)
专题命中
评测与基准
:LLM(title);large language model(abstract);language model(abstract);分类 cs.AI