arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-08-11 至 2025-08-11 共收录 8 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 8 篇

2508.06009 2025-08-11 cs.CV 86%

MathReal: We Keep It Real! A Real Scene Benchmark for Evaluating Math Reasoning in Multimodal Large Language Models

Jun Feng, Zixin Wang, Zhentao Zhang, Yue Guo, Zhihan Zhou, Xiuyi Chen, Zhenyang Li, Dawei Yin

专题命中 数学推理 :reasoning(title,abstract);math reasoning(title)

Comments 29 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11881 2025-08-11 cs.AI cs.CL 81%

Hypothesis-Driven Theory-of-Mind Reasoning for Large Language Models

Hyunwoo Kim, Melanie Sclar, Tan Zhi-Xuan, Lance Ying, Sydney Levine, Yang Liu, Joshua B. Tenenbaum, Yejin Choi

机构 * NVIDIA(NVIDIA公司) University of Washington(华盛顿大学) MIT(麻省理工学院) Harvard University(哈佛大学) Amazon(亚马逊公司) Stanford University(斯坦福大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

Comments COLM 2025. For code and data, see https://hyunw.kim/thought-tracing

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20160 2025-08-11 cs.CL 79%

AALC: Large Language Model Efficient Reasoning via Adaptive Accuracy-Length Control

Ruosen Li, Ziming Luo, Quan Zhang, Ruochen Li, Ben Zhou, Ali Payani, Xinya Du

机构 * University of Texas at Dallas(德克萨斯大学达拉斯分校) Arizona State University(亚利桑那州立大学) Cisco Research(思科研究)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05928 2025-08-11 cs.LG 79%

Mitigating Think-Answer Mismatch in LLM Reasoning Through Noise-Aware Advantage Reweighting

Si Shen, Peijun Shen, Wenhua Zhao, Danhao Zhu

专题命中 数学推理 :reasoning(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07124 2025-08-11 cs.CL 70%

Structural Reformation of Large Language Model Neuron Encapsulation for Divergent Information Aggregation

Denis Bakushev, Gideon Boultinghouse, Harriet Oppenheimer, Sebastian Gillingwater, Valentina Ashington, Wilfred Stanborough

专题命中 数学推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.CL

Comments arXiv admin note: This paper has been withdrawn by arXiv due to disputed and unverifiable authorship

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06062 2025-08-11 cs.AI cs.LG cs.LO 62%

Don't Forget Imagination!

Evgenii E. Vityaev, Andrei Mantsivoda

机构 * Sobolev Institute of mathematics SD RAS(索洛维耶夫数学研究所(SD RAS)) Irkutsk State University(伊尔库茨克州立大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

Comments 14 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06026 2025-08-11 cs.CL cs.AI 62%

Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future

Yidong Wang, Xin Wang, Cunxiang Wang, Junfeng Fang, Qiufeng Wang, Jianing Chu, Xuran Meng, Shuxun Yang, Libo Qin, Yue Zhang, Wei Ye, Shikun Zhang

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07912 2025-08-11 cs.LG 57%

Echo Chamber: RL Post-training Amplifies Behaviors Learned in Pretraining

Rosie Zhao, Alexandru Meterez, Sham Kakade, Cengiz Pehlevan, Samy Jelassi, Eran Malach

机构 * Harvard University(哈佛大学) Kempner Institute(凯普纳研究所)

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

Comments COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏