Calibrated? Not for Everyone: How Sexual Orientation and Religious Markers Distort LLM Accuracy and Confidence in Medical QA
校准?并非人人适用:性取向和宗教标志如何扭曲LLM在医疗问答中的准确性和置信度
Alberto Testoni, Iacer Calixto
机构
*
Department of Medical Informatics, Amsterdam University Medical Center, University of Amsterdam, Amsterdam, The Netherlands(阿姆斯特丹大学医学信息学系,阿姆斯特丹大学医学中心,阿姆斯特丹,荷兰)
;
Amsterdam Public Health, Methodology, Amsterdam, The Netherlands(阿姆斯特丹公共卫生,方法学,阿姆斯特丹,荷兰)
专题命中
领域大模型
:LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
ResearchBench: Benchmarking LLMs in Scientific Discovery via Inspiration-Based Task Decomposition
ResearchBench: 通过基于灵感的任务分解对LLM在科学发现中的基准测试
Yujie Liu, Zonglin Yang, Tong Xie, Jinjie Ni, Ben Gao, Yuqiang Li, Shixiang Tang, Wanli Ouyang, Erik Cambria, Dongzhan Zhou
机构
*
Fudan University(复旦大学)
;
Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
;
Nanyang Technological University(南洋理工大学)
;
University of New South Wales(新南威尔士大学)
;
National University of Singapore(新加坡国立大学)
;
Wuhan University(武汉大学)
专题命中
领域大模型
:LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);pretraining(abstract)
Faithfulness vs. Safety: Evaluating LLM Behavior Under Counterfactual Medical Evidence
忠实性与安全性:在反事实医学证据下评估LLM行为
Kaijie Mo, Siddhartha Venkatayogi, Chantal Shaib, Ramez Kouzy, Wei Xu, Byron C. Wallace, Junyi Jessy Li
机构
*
The University of Texas at Austin(德克萨斯大学奥斯汀分校)
;
Northeastern University(东北大学)
;
MD Anderson Cancer Center(MD安德森癌症中心)
;
Georgia Institute of Technology(佐治亚理工学院)
Large Language Models Are Still Misled by Simple Bias Ensembles
大语言模型仍易受简单偏见集合的误导
Zhouhao Sun, Zhiyuan Kan, Xiao Ding, Li Du, Bibo Cai, Yang Zhao, Bing Qin, Ting Liu
机构
*
Research Center for Social Computing and Interactive Robotics(社会计算与交互机器人研究中心)
;
Harbin Institute of Technology(哈尔滨工业大学)
;
Beijing Academy of Artificial Intelligence(北京人工智能研究院)
专题命中
领域大模型
:large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI
Scaling Recurrence-aware Foundation Models for Clinical Records via Next-Visit Prediction
通过下一步预测扩展临床记录的复发意识基础模型
Haresh Rengaraj Rajamohan, Xiang Gao, Weicheng Zhu, Shih-Lun Huang, Long Chen, Gabe Schulman, Huizhen Jin, Shengduo Li, Yixuan Wang, Huidi Yang, Kyunghyun Cho, Cem M. Deniz, Narges Razavian
机构
*
Center for Data Science(数据科学中心)
;
New York University(纽约大学)
;
Department of Radiology(放射科)
;
NYU Grossman School of Medicine(NYU Grossman医学院)
;
Center for Biomedical Imaging(生物医学成像中心)
;
Department of Population Health(人群健康部)
专题命中
领域大模型
:foundation model(title,abstract);large language model(abstract);language model(abstract);pretraining(abstract)
StealthGraph: Exposing Domain-Specific Risks in LLMs through Knowledge-Graph-Guided Harmful Prompt Generation
StealthGraph:通过知识图谱引导的有害提示生成暴露领域特定风险
Huawei Zheng, Xinqi Jiang, Sen Yang, Shouling Ji, Yingcai Wu, Dazhen Deng
机构
*
School of Software Technology, Zhejiang University(浙江大学软件学院)
;
College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院)
;
State Key Lab of CAD&CG, Zhejiang University(浙江大学CAD&CG国家重点实验室)
专题命中
领域大模型
:LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
Deep reflective reasoning in interdependence constrained structured data extraction from clinical notes for digital health
在临床笔记中进行深度反思推理以提取受相互依赖约束的结构化数据用于数字健康
Jingwei Huang, Kuroush Nezafati, Zhikai Chi, Ruichen Rong, Colin Treager, Tingyi Wanyan, Yueshuang Xu, Xiaowei Zhan, Patrick Leavey, Guanghua Xiao, Wenqi Shi, Yang Xie
机构
*
Quantitative Biomedical Research Center, Department of Health Data Science and Biostatistics, Peter O'Donnell School of Public Health, University of Texas Southwestern Medical Center(定量生物医学研究中心,健康数据科学与生物统计学系,彼得·奥·多尼尔公共卫生学院,德克萨斯西南医学中心)
专题命中
领域大模型
:LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI
Infherno: End-to-end Agent-based FHIR Resource Synthesis from Free-form Clinical Notes
Infherno:从非结构化临床笔记到端到端的FHIR资源合成
Johann Frei, Nils Feldhus, Lisa Raithel, Roland Roller, Alexander Meyer, Frank Kramer
机构
*
IT-Infrastructure for Translational Medical Research(转化医学研究信息基础设施)
;
BIFOLD – Berlin Institute for the Foundations of Learning and Data(柏林学习与数据基础研究所)
;
Technische Universität Berlin(柏林技术大学)
;
German Research Center for Artificial Intelligence (DFKI), Berlin(德国人工智能研究中心(DFKI),柏林)
;
IKIM, Charité - Universitätsmedizin Berlin(IKIM,柏林夏里特大学医学中心)
Foundation Model for Cardiac Time Series via Masked Latent Attention
通过掩码潜在注意力的心脏时间序列基础模型
Moritz Vandenhirtz, Samuel Ruipérez-Campillo, Simon Böhi, Sonia Laguna, Irene Cannistraci, Andrea Agostini, Ece Ozkan, Thomas M. Sutter, Julia E. Vogt
机构
*
Department of Computer Science, ETH Zurich, Switzerland(苏黎世联邦理工学院计算机科学系,瑞士)
;
Department of Biomedical Engineering, University of Basel, Switzerland(巴塞尔大学生物医学工程系,瑞士)
机构
*
The University of Hong Kong(香港大学)
;
Shanghai AI Laboratory(上海人工智能实验室)
;
Fudan University(复旦大学)
;
Peking University(北京大学)
;
Nanjing University(南京大学)
;
East China Normal University(华东师范大学)
;
Yale University(耶鲁大学)
专题命中
领域大模型
:LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
Dissecting AI Trading: Behavioral Finance and Market Bubbles
解析人工智能交易:行为金融与市场泡沫
Shumiao Ouyang, Pengfei Sui
机构
*
Saïd Business School, University of Oxford(牛津大学said商学院)
;
School of Management and Economics, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)管理学院)
专题命中
领域大模型
:LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI
BenchMarker: An Education-Inspired Toolkit for Highlighting Flaws in Multiple-Choice Benchmarks
BenchMarker:一种受教育启发的工具包,用于突出多项选择基准测试中的缺陷
Nishant Balepur, Bhavya Rajasekaran, Jane Oh, Michael Xie, Atrey Desai, Vipul Gupta, Steven James Moore, Eunsol Choi, Rachel Rudinger, Jordan Lee Boyd-Graber
机构
*
University of Maryland(马里兰大学)
;
New York University(纽约大学)
;
Scale AI
;
George Mason University(乔治·梅森大学)