Zebra-CoT: A Dataset for Interleaved Vision Language Reasoning
Ang Li, Charles Wang, Deqing Fu, Kaiyu Yue, Zikui Cai, Wang Bill Zhu, Ollie Liu, Peng Guo, Willie Neiswanger, Furong Huang, Tom Goldstein, Micah Goldblum
机构
*
Columbia University(哥伦比亚大学)
;
University of Maryland(马里兰大学)
;
University of Southern California(南加州大学)
;
New York University(纽约大学)
ReasonMed: A 370K Multi-Agent Generated Dataset for Advancing Medical Reasoning
Yu Sun, Xingyu Qian, Weiwen Xu, Hao Zhang, Chenghao Xiao, Long Li, Deli Zhao, Wenbing Huang, Tingyang Xu, Qifeng Bai, Yu Rong
机构
*
Alibaba DAMO Academy(阿里巴巴达摩院)
;
School of Basic Medical Sciences, Lanzhou University(兰州大学基础医学学院)
;
Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学光荣人工智能学院)
;
Beijing Key Laboratory of Research on Large Models and Intelligent Governance(北京大型模型与智能治理研究重点实验室)
;
Engineering Research Center of Next-Generation Intelligent Search and Recommendation, MOE(教育部下一代智能搜索与推荐工程研究中心)
Comments15 pages, 5 tables, 4 figures; full research paper currently under review for the Workshop on Information Technologies and Systems (WITS) 2025. The paper presents a comprehensive evaluation of large language models (LLMs) for business process model analysis and optimization, including error detection, reasoning, and scenario-based redesign
Reducing Large Language Model Safety Risks in Women's Health using Semantic Entropy
Jahan C. Penny-Dimri, Magdalena Bachmann, William R. Cooke, Sam Mathewlynn, Samuel Dockree, John Tolladay, Jannik Kossen, Lin Li, Yarin Gal, Gabriel Davis Jones
机构
*
Oxford Digital Health Labs, Nuffield Department of Women’s and Reproductive Health(牛津数字健康实验室,女性与生殖健康系)
;
University of Oxford(牛津大学)
;
Oxford University Hospitals NHS Foundation Trust(牛津大学医院 NHS 基础信托)
;
OATML, Department of Computer Science(OATML,计算机科学系)
AppForge: From Assistant to Independent Developer -- Are GPTs Ready for Software Development?
Dezhi Ran, Yuan Cao, Mengzhou Wu, Simin Chen, Yuzhe Guo, Jun Ren, Zihe Song, Hao Yu, Jialei Wei, Linyi Li, Wei Yang, Baishakhi Ray, Tao Xie
机构
*
Key Lab of HCST (PKU), MOE(HCST关键实验室(PKU))
;
School of Computer Science, Peking University, China(北京大学计算机科学学院)
;
Columbia University, USA(哥伦比亚大学)
;
Beijing Jiaotong University, China(北京交通大学)
;
University of Texas at Dallas, USA(德克萨斯大学达拉斯分校)
;
Hong Kong University of Science and Technology, Hong Kong SAR, China(香港科技大学)
;
Fudan University Institute of Systems for Advanced Computing, Shanghai, China(复旦大学先进计算系统研究所)
;
Simon Fraser University, Canada(西蒙弗雷泽大学)
;
Shanghai Institute of Systems for Open Computing, Shanghai, China(上海开放计算系统研究所)
BixBench: a Comprehensive Benchmark for LLM-based Agents in Computational Biology
Ludovico Mitchener, Jon M Laurent, Alex Andonian, Benjamin Tenmann, Siddharth Narayanan, Geemi P Wellawatte, Andrew White, Lorenzo Sani, Samuel G Rodriques
Can Large Language Models Be Trusted as Evolutionary Optimizers for Network-Structured Combinatorial Problems?
Jie Zhao, Tao Wen, Kang Hao Cheong
机构
*
Division of Mathematical Sciences, School of Physical and Mathematical Sciences, Nanyang Technological University(数学科学系,物理与数学科学学院,南洋理工大学)
;
School of Computer Science and Engineering, Nanyang Technological University(计算机科学与工程学院,南洋理工大学)
机构
*
Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区)
;
Hong Kong Polytechnic University(香港理工大学)
;
Zhuhai Campus of Sun Yat-sen University(中山大学珠海校区)
;
University of Adelaide(阿德莱德大学)
;
Peking University(北京大学)
;
Huawei Noah’s Ark Lab(华为诺亚实验室)