Building Trust in Clinical LLMs: Bias Analysis and Dataset Transparency
机构 * M42, Abu Dhabi(阿布扎比M42)
专题命中 评测与基准 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.CL
Comments Accepted to EMNLP Main 2025
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
机构 * M42, Abu Dhabi(阿布扎比M42)
专题命中 评测与基准 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.CL
Comments Accepted to EMNLP Main 2025
机构 * IIT Kharagpur, India(印度理工学院Kharagpur) ; Adobe Research, India(Adobe研究) ; IIT Bhubaneswar, India(印度理工学院Bhubaneswar)
专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL
Comments EMNLP 2025 Main Conference Full Paper
Journal ref EMNLP 2025 Main Conference Full Paper
机构 * IBM Research(IBM研究院)
专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI
专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)
Comments Under review
机构 * Fudan University(复旦大学) ; Center for Applied Statistics and School of Statistics, Renmin University of China(应用统计中心和中国人民大学统计学院) ; Beijing Advanced Innovation Center for Future Blockchain and Privacy Computing(北京未来区块链与隐私计算高级创新中心)
专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG
Comments Accepted by Neural Information Processing Systems (NeurIPS 2025)
机构 * Naver Cloud(Naver云) ; Graduate School of Data Science, Seoul National University(数据科学研究生院,首尔国立大学)
专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL
机构 * Al Akhawayn University(阿尔阿克哈文大学)
专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI
Comments 15 pages, 2 figures, 10 tables. Source code and experimental artifacts are available at: https://github.com/aymanehassini/DynaQuery . The 'DynaQuery-Eval-5K' benchmark, introduced in this work, is also publicly available at: https://www.kaggle.com/datasets/aymanehassini/dynaquery-eval-5k-benchmark
机构 * Department of Computer Science and Software Engineering, Miami University, Oxford, Ohio(计算机科学与软件工程系,迈阿密大学,俄亥俄州奥克兰) ; Farmer School of Business, Miami University, Oxford, Ohio(农学商学院,迈阿密大学,俄亥俄州奥克兰)
专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.LG
机构 * Algoverse ; Microsoft
专题命中 评测与基准 :language model(abstract,comments);分类 cs.AI、cs.LG;large language model(comments)
Comments Accepted to 39th Conference on Neural Information Processing Systems (NeurIPS 2025) Workshop: Multi-Turn Interactions in Large Language Models
Journal ref Neural Information Processing Systems (NeurIPS 2025)
专题命中 评测与基准 :large language model(abstract);language model(abstract)
机构 * The Fu Foundation School of Engineering and Applied Science, Columbia University(哥伦比亚大学福基金会工程与应用科学学院) ; School of Nursing, Columbia University(哥伦比亚大学护理学院) ; Center for Home Care Policy & Research, VNS Health(VNS健康居家护理政策与研究中心)
专题命中 评测与基准 :large language model(abstract);language model(abstract)
Comments The Second Workshop on GenAI for Health at NeurIPS 2025
专题命中 评测与基准 :large language model(abstract);language model(abstract)
专题命中 评测与基准 :large language model(abstract);language model(abstract)
专题命中 评测与基准 :large language model(abstract);language model(abstract)
专题命中 评测与基准 :large language model(abstract);language model(abstract)
Comments 28 pages, 8 figures, submitted at computers & geosciences journal
机构 * Carnegie Mellon University - Language Technologies Institute(卡内基梅隆大学-语言技术研究所)
专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI、cs.LG
Comments EMNLP 2025 Findings
机构 * INFLY Tech(INFLY科技) ; Australian Artificial Intelligence Institute(澳大利亚人工智能研究所) ; University of Liverpool(利物浦大学)
专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI、cs.LG
Comments 16 pages, 12 figures
机构 * City University of Hong Kong(香港城市大学) ; OPPO Research Institute(OPPO研究院) ; The Hong Kong Polytechnic University(香港理工大学)
专题命中 评测与基准 :large language model(abstract);language model(abstract)
专题命中 评测与基准 :LLM(abstract);分类 cs.AI、cs.LG
机构 * University of Michigan(密歇根大学) ; Stanford University(斯坦福大学) ; University of Illinois Urbana–Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 评测与基准 :language model(abstract);分类 cs.AI
机构 * NYU(纽约大学) ; Stanford(斯坦福大学)
专题命中 评测与基准 :language model(abstract);分类 cs.AI
机构 * ETH Zürich(苏黎世联邦理工学院) ; Stanford University(斯坦福大学) ; Microsoft Spatial AI Lab(微软空间人工智能实验室) ; HUN-REN SZTAKI(匈牙利-罗马尼亚科学院)
专题命中 评测与基准 :language model(abstract);分类 cs.CL
Comments Published on ICCV 2025
机构 * Université Paris-Saclay, CEA, List(巴黎-萨克雷大学,CEA,List)
专题命中 评测与基准 :pretraining(abstract);分类 cs.AI
Comments To be published in NeurIPS 2025 Track on Datasets and Benchmarks
机构 * Independent Researcher(独立研究者)
专题命中 评测与基准 :LLM(abstract);分类 cs.AI
Comments 15 pages,6 figs
机构 * Zhejiang University(浙江大学) ; Alibaba Group(阿里巴巴集团) ; Shanghai AI Lab(上海人工智能实验室)
专题命中 评测与基准 :language model(abstract)
机构 * Youtu-Agent Team(YouTu-Agent团队)
专题命中 评测与基准 :language model(abstract)
Comments 24 pages, 6 figures
专题命中 评测与基准 :LLM(abstract)
Comments Table 13, figure 2
机构 * Institute of Artificial Intelligence (TeleAI), China Telecom, China(人工智能研究院(TeleAI)、中国电信)
专题命中 评测与基准 :language model(abstract)
Comments We have released V1, which only reports the test results. Our work is still ongoing, and the next version will be coming soon
机构 * The University of Tokyo(东京大学) ; RIKEN AIP(理化学研究所AIP) ; Waseda University(早稻田大学) ; Stony Brook University(石溪大学) ; Stanford University(斯坦福大学)
专题命中 评测与基准 :language model(abstract)
Comments A multi-hazard, multi-sensor, and multi-task vision-language dataset for global-scale disaster assessment and response
机构 * University of Surrey, UK(Surrey大学)
专题命中 评测与基准 :foundation model(abstract)
Comments Accepted at the NeurIPS 2024 Workshop on Audio Imagination; this version updates the project page link