arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-08-31 至 2026-08-31 共收录 6 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 6 篇

2511.14684 2026-08-31 cs.CL 版本更新 85%

SMRC: Aligning Large Language Models with Student Reasoning for Mathematical Error Correction

SMRC:使大语言模型与学生数学推理对齐以进行数学错误修正

Biaojie Zeng, Min Zhang, Juan Zhou, Fengrui Liu, Ruiyang Huang, Yu Song, Xin Lin

机构 * East China Normal University(华东师范大学) East Chine Normal University(华东师范大学) Southeast University(东南大学)

专题命中 数学推理 :reasoning(title,abstract);self-correction(abstract);分类 cs.CL

AI总结 该研究针对大语言模型数学推理错误的教育场景修正需求,提出SMRC方法,结合MCTS等技术构建高中数学基准MSEB,实验显示其在多数据集上性能优于现有方法。

Comments Accepted to Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08577 2026-08-31 cs.CL cs.AI cs.LG cs.PF 版本更新 82%

Think-at-Hard: Dynamic Looped Transformers for Improved Reasoning

Think-at-Hard: 选择性潜在迭代以改进推理语言模型

Tianyu Fu, Yichen You, Zekai Chen, Guohao Dai, Huazhong Yang, Yu Wang

机构 * Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对循环变压器中潜在过思考问题,提出Think-at-Hard方法,通过轻量级决策器选择性地在困难令牌上触发潜在迭代,并采用深度感知LoRA和双因果注意力机制,在数学、问答和编码任务上一致提升性能。

Comments Accepted by ICML'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28447 2026-08-31 cs.AI 新提交 79%

Learning to Use Tools: Reinforcement Learning for Tool-Integrated Mathematical Reasoning

学习使用工具:用于工具集成数学推理的强化学习

Minghui Xu, Zi Wang

机构 * Stanford University(斯坦福大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本研究针对Countdown任务,构建工具使用的SFT数据集并采用多种强化学习方法,结合计算器工具集成提升LLM数学推理,使pass@1达66.0%,显著降低计算与验证错误。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27501 2026-08-31 cs.CL 新提交 79%

INSPIRE: An Internalize-Then-Improve Approach for Example-Driven Mathematical Reasoning

INSPIRE:一种用于示例驱动数学推理的“先内化再改进”方法

Shuai Wang, Jiayi Kuang, Yinghui Li, Haojing Huang, Xinnian Liang, Ying Shen, Liang Lin

机构 * Sun Yat-sen University(中山大学) Tsinghua University(清华大学) ByteDance Inc.(字节跳动公司) Peng Cheng Laboratory(鹏城实验室)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 该研究针对LLMs数学推理中内化不足的问题,提出INSPIRE方法,结合RGSI与分阶段规则偏好训练,提升了示例驱动数学推理能力且未降低通用推理水平。

Comments EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28481 2026-08-31 cs.CL cs.AI 新提交 62%

NL2AGBench: Benchmarking LLM Auto-Formalization for AlphaGeometry

NL2AGBench:面向AlphaGeometry的大语言模型自动形式化基准测试

Samuel Xiao, Judy Song, Rory Hu, Ziliang Zong

机构 * Valley Christian High School(谷基督高中) Vandegrift High School(范德格里夫特高中) Groton School(格罗顿学校) Texas State University(德克萨斯州立大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 该研究提出NL2AGBench基准,评估LLMs将英文几何问题转换为AlphaGeometry兼容形式化表示的能力,发现闭源模型可实现80%以上可执行翻译率,开源模型表现欠佳,还提出错误分类法并验证了多种缓解策略的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27513 2026-08-31 cs.LG cs.AI 新提交 62%

DAMP: Decay-Aware Mixed-Precision Recurrent-State Quantization

DAMP:感知衰减的混合精度循环状态量化

Tao Zhang, Jianchao Tan, Pingwei Sun, Yanqi Yu, Zixu Jiang, Yuchen Xie, Xunliang Cai, Ziqian Zeng

机构 * South China University of Technology(华南理工大学) Meituan(美团) East China Normal University(华东师范大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 DAMP是针对GDN、KDA类语言模型循环状态的混合精度量化方法,通过识别高风险通道差异化精度存储,在接近FP32基线精度的同时大幅降低存储、加速更新并减少推理延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏