arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-08-25 至 2025-08-25 共收录 12 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 12 篇

2508.16213 2025-08-25 cs.CV 85%

MedOmni-45°: A Safety-Performance Benchmark for Reasoning-Oriented LLMs in Medicine

Kaiyuan Ji, Yijin Guo, Zicheng Zhang, Xiangyang Zhu, Yuan Tian, Ning Liu, Guangtao Zhai

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract)

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16383 2025-08-25 cs.AI cs.CL cs.CY 81%

GLARE: Agentic Reasoning for Legal Judgment Prediction

Xinyu Yang, Chenlong Deng, Zhicheng Dou

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学北京校区人工智能学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15797 2025-08-25 cs.CL cs.AI cs.LG 78%

Benchmarking the Medical Understanding and Reasoning of Large Language Models in Arabic Healthcare Tasks

Nouar AlDahoul, Yasir Zaki

专题命中 推理评测 :reasoning(title);分类 cs.CL、cs.AI、cs.LG

Comments 5 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15835 2025-08-25 cs.CL cs.AI 73%

Alvorada-Bench: Can Language Models Solve Brazilian University Entrance Exams?

Henrique Godoy

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16357 2025-08-25 cs.CL cs.AI cs.IR 62%

MizanQA: Benchmarking Large Language Models on Moroccan Legal Question Answering

Adil Bahaj, Mounir Ghogho

机构 * Mohammed 6 Polytechnic University(穆莱·马哈茂德六世理工学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15876 2025-08-25 cs.CL cs.AI cs.MA 62%

DeepMEL: A Multi-Agent Collaboration Framework for Multimodal Entity Linking

Fang Wang, Tianwei Yan, Zonghao Yang, Minghao Hu, Jun Zhang, Zhunchen Luo, Xiaoying Bai

机构 * School of Computer Science, Peking University(北京大学计算机科学学院) School of Information Science and Engineering, Chongqing Jiaotong University(重庆交通大学信息科学与工程学院) China Research and Development Academy of Machinery Equipment(机械电子研究发展院) Center of Information Research, Academy of Military Science(军事科学信息研究中心)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15802 2025-08-25 cs.CL cs.AI 62%

MAC: A Live Benchmark for Multimodal Large Language Models in Scientific Understanding

Mohan Jiang, Jin Gao, Jiahao Zhan, Dequan Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) Fudan University(复旦大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16402 2025-08-25 cs.SE cs.CL 57%

AetherCode: Evaluating LLMs' Ability to Win In Premier Programming Competitions

Zihan Wang, Jiaze Chen, Zhicheng Liu, Markus Mak, Yidi Du, Geonsik Moon, Luoqi Xu, Aaron Tua, Kunshuo Peng, Jiayi Lu, Mingfei Xia, Boqian Zou, Chenyang Ran, Guang Tian, Shoutai Zhu, Yeheng Duan, Zhenghui Kang, Zhenxing Lin, Shangshu Li, Qiang Luo, Qingshen Long, Zhiyong Chen, Yihan Xiao, Yurong Wu, Daoguang Zan, Yuyi Fu, Mingxuan Wang, Ming Ding

机构 * ByteDance M-A-P(字节跳动 M-A-P)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16265 2025-08-25 cs.CL 57%

M3TQA: Massively Multilingual Multitask Table Question Answering

Daixin Shu, Jian Yang, Zhenhe Wu, Xianjie Wu, Xianfu Cheng, Xiangyuan Guan, Yanghai Wang, Pengfei Wu, Tingyang Yang, Hualei Zhu, Wei Zhang, Ge Zhang, Jiaheng Liu, Zhoujun Li

机构 * CCSE, Beihang University(计算机科学与工程学院,北京航空航天大学) M-A-P(M-A-P研究所) Nanjing University(南京大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.10868 2025-08-25 cs.CL 57%

NitiBench: A Comprehensive Study of LLM Framework Capabilities for Thai Legal Question Answering

Pawitsapak Akarajaradwong, Pirat Pothavorn, Chompakorn Chaksangchaichot, Panuthep Tasawong, Thitiwat Nopparatbundit, Keerakiat Pratai, Sarana Nutanong

机构 * VISAI AI(VISAI人工智能) Vidyasirimedhi Institute of Science and Technology(维达亚西米德希科学与技术研究院) Faculty of Law, Thammasat University(朱拉隆功大学法学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.17032 2025-08-25 cs.CL 57%

MINTQA: A Multi-Hop Question Answering Benchmark for Evaluating LLMs on New and Tail Knowledge

Jie He, Nan Hu, Wanqiu Long, Jiaoyan Chen, Jeff Z. Pan

机构 * School of Informatics, University of Edinburgh, UK(爱丁堡大学信息学院) Southeast University, Nanjing, Jiangsu, China(东南大学) University of Manchester, UK(曼彻斯特大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15904 2025-08-25 cs.CV 50%

Boosting Pathology Foundation Models via Few-shot Prompt-tuning for Rare Cancer Subtyping

Dexuan He, Xiao Zhou, Wenbin Guan, Liyuan Zhang, Xiaoman Zhang, Sinuo Xu, Ge Wang, Lifeng Wang, Xiaojun Yuan, Xin Sun, Yanfeng Wang, Kun Sun, Ya Zhang, Weidi Xie

机构 * School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院) Department of Biomedical Informatics, Harvard Medical School(哈佛医学院生物医学信息学系) Department of Oral Pathology, Shanghai Ninth People’s Hospital, Shanghai Jiao Tong University School of Medicine(上海交通大学医学院第九人民医院口腔病学部) Department of Pathology, Xinhua Hospital Affiliated to Shanghai Jiao Tong University School of Medicine(上海交通大学医学院新华医院病理科) Department of Pediatric Hematology/Oncology, Xinhua Hospital Affiliated to Shanghai Jiao Tong University School of Medicine(上海交通大学医学院新华医院儿童血液肿瘤科) Clinical Research and Innovation Unit, Xinhua Hospital Affiliated to Shanghai Jiao Tong University School of Medicine(上海交通大学医学院新华医院临床研究与创新单元) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 推理评测 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏