arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-10-03 至 2025-10-03 共收录 13 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 13 篇

2503.03238 2025-10-03 cs.CL cs.AI 88%

FANS -- Formal Answer Selection for Natural Language Math Reasoning Using Lean4

Jiarui Yao, Ruida Wang, Tong Zhang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 数学推理 :reasoning(title,abstract);math reasoning(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01528 2025-10-03 cs.AI cs.LG 87%

Towards Interpretable and Inference-Optimal COT Reasoning with Sparse Autoencoder-Guided Generation

Daniel Zhao, Abhilash Shankarampeta, Lanxiang Hu, Tajana Rosing, Hao Zhang

机构 * University of California, San Diego(加州大学圣地亚哥分校)

专题命中 数学推理 :reasoning(title,abstract);CoT(title);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21998 2025-10-03 cs.AI cs.LG 84%

GSM-Agent: Understanding Agentic Reasoning Using Controllable Environments

Hanlin Zhu, Tianyu Guo, Song Mei, Stuart Russell, Nikhil Ghosh, Alberto Bietti, Jiantao Jiao

机构 * UC Berkeley(加州大学伯克利分校) Flatiron Institute(Flatiron研究所) Nvidia(英伟达)

专题命中 数学推理 :reasoning(title,abstract);math reasoning(abstract);分类 cs.AI、cs.LG

Comments 39 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02230 2025-10-03 cs.AI cs.CL cs.CV 81%

The Reasoning Boundary Paradox: How Reinforcement Learning Constrains Language Models

Phuc Minh Nguyen, Chinh D. La, Duy M. H. Nguyen, Nitesh V. Chawla, Binh T. Nguyen, Khoa D. Doan

机构 * College of Engineering and Computer Science, VinUniversity(Vin大学工程与计算机科学学院) Center for Environmental Intelligence, VinUniversity(Vin大学环境智能中心) University of Stuttgart(斯图加特大学) University of Notre Dame(诺特难大学) German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心) Max Planck Research School for Intelligent Systems (IMPRS-IS)(马克斯·普朗克智能系统研究学校)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

Comments 23 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01539 2025-10-03 cs.LG 79%

Executable Counterfactuals: Improving LLMs' Causal Reasoning Through Code

Aniket Vashishtha, Qirun Dai, Hongyuan Mei, Amit Sharma, Chenhao Tan, Hao Peng

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) The University of Chicago(芝加哥大学) TTIC Microsoft Research India(微软印度研究院)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01241 2025-10-03 cs.CL 79%

SKYLENAGE Technical Report: Mathematical Reasoning and Contest-Innovation Benchmarks for Multi-Level Math Evaluation

Hu Wei, Ze Xu, Boyu Yang, Linlin Miao, Weiqi Zhai, Yihan Li, Zixuan Li, Zhijun Wang, Boya Wang, Jianwei Yu, Jialing Yuan, Xiaoyue Zhang, Cheng He, Minglei Chen, Zifan Zhang, Qianhui Li, Wei Wang, Xiang Xu

机构 * SKYLENAGE

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21499 2025-10-03 cs.CL cs.PL 79%

On Code-Induced Reasoning in LLMs

Abdul Waheed, Zhen Wu, Carolyn Rosé, Daphne Ippolito

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01624 2025-10-03 cs.LG cs.AI cs.CL 67%

Quagmires in SFT-RL Post-Training: When High SFT Scores Mislead and What to Use Instead

Feiyang Kang, Michael Kuchnik, Karthik Padthe, Marin Vlastelica, Ruoxi Jia, Carole-Jean Wu, Newsha Ardalani

机构 * FAIR at Meta(Meta 的 FAIR) Meta

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Preprint. Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.19557 2025-10-03 cs.CL cs.AI cs.LG 67%

Initialization using Update Approximation is a Silver Bullet for Extremely Efficient Low-Rank Fine-Tuning

Kaustubh Ponkshe, Raghav Singhal, Eduard Gorbunov, Alexey Tumanov, Samuel Horvath, Praneeth Vepakomma

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Georgia Institute of Technology(佐治亚理工学院) Massachusetts Institute of Technology(麻省理工学院)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Kaustubh Ponkshe and Raghav Singhal contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01253 2025-10-03 cs.AI cs.LG 62%

OR-Toolformer: Modeling and Solving Operations Research Problems with Tool Augmented Large Language Models

Jianzhang Zhang, Jialong Zhou, Chuang Liu

机构 * Alibaba Business School(阿里巴巴商业学院) Hangzhou Normal University(杭州师范大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01831 2025-10-03 cs.CL 57%

Syntactic Blind Spots: How Misalignment Leads to LLMs Mathematical Errors

Dane Williamson, Yangfeng Ji, Matthew Dwyer

机构 * Department of Computer Science(计算机科学系) University of Virginia(弗吉尼亚大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

Comments 14 pages, 5 Tables, 9 Figures; Accepted to MathNLP 2025: The 3rd Workshop on Mathematical Natural Language Processing (co-located with EMNLP 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01246 2025-10-03 cs.CL 57%

A Comparative Analysis of Sparse Autoencoder and Activation Difference in Language Model Steering

Jiaqing Xie

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26399 2025-10-03 cs.AI 57%

Communication-Efficient and Accurate Approach for Aggregation in Federated Low-Rank Adaptation

Le-Tuan Nguyen, Minh-Duong Nguyen, Seon-Geun Jeong, Dung D. Le, Quoc-Viet Pham

机构 * VinUniversity(文大学) Trinity College Dublin(三一学院都柏林) Pusan National University(釜山国立大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

Comments 34 pages, 4 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏