arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-10-16 至 2025-10-16 共收录 5 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 5 篇

2506.13886 2025-10-16 cs.CL cs.AI 81%

Investigating the interaction of linguistic and mathematical reasoning in language models using multilingual number puzzles

Antara Raaghavi Bhattacharya, Isabel Papadimitriou, Kathryn Davidson, David Alvarez-Melis

机构 * School of Engineering and Applied Sciences, Harvard University(哈佛大学工程与应用科学学院) Department of Linguistics, Harvard University(哈佛大学语言学系) Kempner Institute for the Study of Natural and Artificial Intelligence at Harvard University(哈佛大学凯普纳自然与人工智能研究 institute)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

Comments Accepted to EMNLP 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21908 2025-10-16 cs.LG cs.AI 81%

Reinforcement Learning for Out-of-Distribution Reasoning in LLMs: An Empirical Study on Diagnosis-Related Group Coding

Hanyin Wang, Zhenbang Wu, Gururaj Kolar, Hariprasad Korsapati, Brian Bartlett, Bryan Hull, Jimeng Sun

机构 * School of Computing and Data Science, UIUC(计算与数据科学学院,UIUC) Mayo Clinic Health System(梅奥诊所健康系统) Mayo Clinic Rochester(梅奥诊所罗切斯特分部) Mayo Clinic Phoenix(梅奥诊所凤凰城分部) Carle Illinois College of Medicine, UIUC(Carle伊利诺伊医学院,UIUC)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13501 2025-10-16 cs.AI 77%

Confidence as a Reward: Transforming LLMs into Reward Models

He Du, Bowen Li, Chengxing Xie, Chang Gao, Kai Chen, Dacheng Tao

机构 * Fudan University(复旦大学) Shanghai AI Laboratory(上海人工智能实验室) Xidian University(西安电子科技大学) The Chinese University of Hong Kong(香港中文大学) Nanyang Technological University(南洋理工大学)

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13744 2025-10-16 cs.AI cs.CL cs.LG 75%

Hard2Verify: A Step-Level Verification Benchmark for Open-Ended Frontier Math

Shrey Pandit, Austin Xu, Xuan-Phi Nguyen, Yifei Ming, Caiming Xiong, Shafiq Joty

机构 * Salesforce AI Research(Salesforce AI研究)

专题命中 数学推理 :reasoning(abstract);verifier(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 21 pages, 8 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07312 2025-10-16 cs.LG cs.AI 66%

h1: Bootstrapping LLMs to Reason over Longer Horizons via Reinforcement Learning

Sumeet Ramesh Motwani, Alesia Ivanova, Ziyang Cai, Philip Torr, Riashat Islam, Shital Shah, Christian Schroeder de Witt, Charles London

机构 * University of Oxford(牛津大学) Princeton University(普林斯顿大学) Microsoft AI Frontiers(微软人工智能前沿)

专题命中 数学推理 :reasoning(abstract,comments);分类 cs.AI、cs.LG

Comments Preprint, 31 pages, 8 figures, long-horizon reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏