Comments15 pages, 5 tables, 4 figures; full research paper currently under review for the Workshop on Information Technologies and Systems (WITS) 2025. The paper presents a comprehensive evaluation of large language models (LLMs) for business process model analysis and optimization, including error detection, reasoning, and scenario-based redesign
Reducing Large Language Model Safety Risks in Women's Health using Semantic Entropy
Jahan C. Penny-Dimri, Magdalena Bachmann, William R. Cooke, Sam Mathewlynn, Samuel Dockree, John Tolladay, Jannik Kossen, Lin Li, Yarin Gal, Gabriel Davis Jones
机构
*
Oxford Digital Health Labs, Nuffield Department of Women’s and Reproductive Health(牛津数字健康实验室,女性与生殖健康系)
;
University of Oxford(牛津大学)
;
Oxford University Hospitals NHS Foundation Trust(牛津大学医院 NHS 基础信托)
;
OATML, Department of Computer Science(OATML,计算机科学系)
AppForge: From Assistant to Independent Developer -- Are GPTs Ready for Software Development?
Dezhi Ran, Yuan Cao, Mengzhou Wu, Simin Chen, Yuzhe Guo, Jun Ren, Zihe Song, Hao Yu, Jialei Wei, Linyi Li, Wei Yang, Baishakhi Ray, Tao Xie
机构
*
Key Lab of HCST (PKU), MOE(HCST关键实验室(PKU))
;
School of Computer Science, Peking University, China(北京大学计算机科学学院)
;
Columbia University, USA(哥伦比亚大学)
;
Beijing Jiaotong University, China(北京交通大学)
;
University of Texas at Dallas, USA(德克萨斯大学达拉斯分校)
;
Hong Kong University of Science and Technology, Hong Kong SAR, China(香港科技大学)
;
Fudan University Institute of Systems for Advanced Computing, Shanghai, China(复旦大学先进计算系统研究所)
;
Simon Fraser University, Canada(西蒙弗雷泽大学)
;
Shanghai Institute of Systems for Open Computing, Shanghai, China(上海开放计算系统研究所)
BixBench: a Comprehensive Benchmark for LLM-based Agents in Computational Biology
Ludovico Mitchener, Jon M Laurent, Alex Andonian, Benjamin Tenmann, Siddharth Narayanan, Geemi P Wellawatte, Andrew White, Lorenzo Sani, Samuel G Rodriques
Can Large Language Models Be Trusted as Evolutionary Optimizers for Network-Structured Combinatorial Problems?
Jie Zhao, Tao Wen, Kang Hao Cheong
机构
*
Division of Mathematical Sciences, School of Physical and Mathematical Sciences, Nanyang Technological University(数学科学系,物理与数学科学学院,南洋理工大学)
;
School of Computer Science and Engineering, Nanyang Technological University(计算机科学与工程学院,南洋理工大学)
机构
*
Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区)
;
Hong Kong Polytechnic University(香港理工大学)
;
Zhuhai Campus of Sun Yat-sen University(中山大学珠海校区)
;
University of Adelaide(阿德莱德大学)
;
Peking University(北京大学)
;
Huawei Noah’s Ark Lab(华为诺亚实验室)
Med-R$^2$: Crafting Trustworthy LLM Physicians via Retrieval and Reasoning of Evidence-Based Medicine
Keer Lu, Zheng Liang, Da Pan, Shusen Zhang, Guosheng Dong, Zhonghai Wu, Huang Leng, Bin Cui, Wentao Zhang
机构
*
Center for Data Science, AAIS Peking University Beijing China(数据科学中心,北京大学北京中国)
;
Baichuan Inc. Beijing China(北川公司北京中国)
;
School of Computer Science Peking University Beijing China(计算机科学学院,北京大学北京中国)
;
Peking University(北京大学)
;
Baichuan Inc.(北川公司)
Enhancing LLM Reliability via Explicit Knowledge Boundary Modeling
Hang Zheng, Hongshen Xu, Yuncong Liu, Lu Chen, Pascale Fung, Kai Yu
机构
*
X-LANCE Lab, School of Computer Science MoE Key Lab of Artificial Intelligence, SJTU AI Institute Shanghai Jiao Tong University, Shanghai, China(X-LANCE实验室,计算机科学学院,人工智能关键实验室,上海交通大学人工智能研究院,上海,中国)
;
Jiangsu Key Lab of Language Computing, Suzhou, China(语言计算重点实验室,苏州,中国)
;
AISpeech Co., Ltd., Suzhou, China(AISpeech公司,苏州,中国)
;
Center for Artificial Intelligence Research (CAiRE) Hong Kong University of Science and Technology, Hong Kong, China(人工智能研究中心(CAiRE)香港科技大学,香港,中国)
;
Suzhou Laboratory, Suzhou, China(苏州实验室,苏州,中国)