MEDIC: Comprehensive Evaluation of Leading Indicators for LLM Safety and Utility in Clinical Applications
MEDIC:对LLM在临床应用中的安全性和实用性领先指标的综合评估
Praveenkumar Kanithi, Clément Christophe, Marco AF Pimentel, Tathagata Raha, Prateek Munjal, Nada Saadi, Hamza A Javed, Svetlana Maslenkova, Nasir Hayat, Ronnie Rajan, Shadab Khan
机构
*
M42
专题命中
评测与基准
:LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
Given, When, Then, Again: Mining Subscenario Refactoring Candidates in Behaviour-Driven Test Suites with ML Classifiers and LLM-Judge Baselines
在行为驱动软件测试套件中挖掘子场景重构机会:ML分类器和LLM-判断基线
Ali Hassaan Mughal, Noor Fatima, Muhammad Bilal
机构
*
Independent Researcher(独立研究者;应用MBA(数据分析),德克萨斯韦斯利安大学)
;
Applied MBA (Data Analytics), Texas Wesleyan University(独立研究者;计算机工程学士,国立科学与技术大学(NUST))
;
Independent Researcher(独立研究者;管理硕士,慕尼黑技术大学)
;
B.E. Computer Engineering, National University of Sciences and Technology (NUST)
;
Independent Researcher
;
M.Sc. Management, Technical University of Munich
专题命中
评测与基准
:LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG
Random Rule Forest (RRF): Interpretable and Manageable Ensembles of LLM-Generated Questions for Predicting Success from Unstructured Data
随机规则森林 (RRF): 基于LLM生成问题的可解释且可控集成方法用于从非结构化数据预测成功
Ben Griffin, Aaron Ontoyin Yin, Diego Vidaurre, Ugur Koyluoglu, Joseph Ternasky, Fuat Alican, Yigit Ihlamur
机构
*
University of Oxford, United Kingdom Aarhus University, Aarhus, Denmark Centre de Recerca Matem\`atica, Barcelona, Spain Oliver Wyman, New York, United States Vela Research, San Francisco, United States
专题命中
评测与基准
:LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)
Ensemble Learning for Large Language Models in Text and Code Generation: A Survey
面向文本与代码生成的大语言模型集成学习综述
Mari Ashiga, Wei Jie, Fan Wu, Vardan Voskanyan, Fateme Dinmohammadi, Paul Brookes, Jingzhi Gong, Zheng Wang
机构
*
School of Computing and Engineering, University of West London(西伦敦大学计算机与工程学院)
;
Turing Intelligence Technology Limited(图灵智能科技有限公司)
;
School of Computer Science, University of Leeds(利兹大学计算机科学学院)
专题命中
评测与基准
:large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG
BenHalluEval: A Multi-Task Hallucination Evaluation Framework for Large Language Models on Bengali
BenHalluEval:孟加拉语大语言模型的多任务幻觉评估框架
Shefayat E Shams Adib, Ahmed Alfey Sani, Ekramul Alam Esham, Ajwad Abrar, Ishmam Tashdeed, Md Taukir Azam Chowdhury
机构
*
Department of Computer Science and Engineering, Islamic University of Technology(伊斯兰科技大学计算机科学与工程系)
;
Department of Computer Science and Engineering, University of California(加州大学计算机科学与工程系)
专题命中
评测与基准
:large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);prompting(abstract)
Target-Side Paraphrase Augmentation for Sign Language Translation with Large Language Models
面向手语翻译的大语言模型目标端释义增强
Pedro Dal Bianco, Jean Paul Nunes Reinhold, Oscar Stanchi, Facundo Quiroga, Franco Ronchetti, Ulisses Brisolara Corrêa
机构
*
III-LIDI Universidad Nacional de La Plata(III-LIDI国立拉普拉塔大学)
;
CDTEC, Federal University of Pelotas(CDTEC,联邦 Pelotas 大学)
;
CONICET III-LIDI
;
Comision de Investigaciones Cientificas Universidad Nacional de La Plata(科学委员会国立拉普拉塔大学)
;
Universidade Federal de Pelotas(联邦 Pelotas 大学)
专题命中
评测与基准
:large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI
CommentsThis submission has been withdrawn because it has been superseded by a substantially revised and expanded version, available as arXiv:2607.27373. Please refer to and cite the newer version