arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 45515 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 3258 篇

2502.00691 2025-07-21 cs.AI cs.CL cs.LG 80%

To Code or not to Code? Adaptive Tool Integration for Math Language Models via Expectation-Maximization

Haozhe Wang, Long Li, Chao Qu, Fengming Zhu, Weidi Xu, Wei Chu, Fangzhen Lin

机构 * Hong Kong University of Science and Technology(香港科技大学) INFLY Tech(INFLY科技)

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted to ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22312 2025-05-30 cs.LG cs.AI cs.CL 80%

Skywork Open Reasoner 1 Technical Report

Jujie He, Jiacai Liu, Chris Yuhao Liu, Rui Yan, Chaojie Wang, Peng Cheng, Xiaoyu Zhang, Fuxiang Zhang, Jiacheng Xu, Wei Shen, Siyuan Li, Liang Zeng, Tianwen Wei, Cheng Cheng, Bo An, Yang Liu, Yahui Zhou

机构 * Skywork Open Reasoner 1

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14852 2025-05-22 cs.CL cs.AI cs.LG 80%

EasyMath: A 0-shot Math Benchmark for SLMs

Drishya Karki, Michiel Kamphuis, Angelecia Frey

机构 * Assistantslab(助手实验室)

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);math reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 17 pages, 9 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.04040 2025-02-11 cs.CL cs.AI cs.LG cs.NE 80%

A Survey on Large Language Models with some Insights on their Capabilities and Limitations

Andrea Matarazzo, Riccardo Torlone

机构 * Expedia Group(亿客行集团) Roma Tre University(罗马第三大学)

专题命中 数学推理 :reasoning(abstract);CoT(abstract);planning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 174 pages, to be submitted to a journal in a shorter version. It includes figures taken from papers by other authors. All the sources have been referenced. arXiv admin note: text overlap with arXiv:2303.18223 by other authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.13549 2024-12-02 cs.CV cs.AI cs.CL cs.LG 80%

A Survey on Multimodal Large Language Models

Shukang Yin, Chaoyou Fu, Sirui Zhao, Ke Li, Xing Sun, Tong Xu, Enhong Chen

专题命中 数学推理 :reasoning(abstract);CoT(abstract);math reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted for publication in National Science Review. Project page:https://github.com/BradyFU/Awesome-Multimodal-Large-Language-Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.12122 2024-09-19 cs.CL cs.AI cs.LG 80%

Qwen2.5-Math Technical Report: Toward Mathematical Expert Model via Self-Improvement

An Yang, Beichen Zhang, Binyuan Hui, Bofei Gao, Bowen Yu, Chengpeng Li, Dayiheng Liu, Jianhong Tu, Jingren Zhou, Junyang Lin, Keming Lu, Mingfeng Xue, Runji Lin, Tianyu Liu, Xingzhang Ren, Zhenru Zhang

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.14624 2024-08-20 cs.CV cs.AI cs.CL cs.LG 80%

MathVerse: Does Your Multi-modal LLM Truly See the Diagrams in Visual Math Problems?

Renrui Zhang, Dongzhi Jiang, Yichi Zhang, Haokun Lin, Ziyu Guo, Pengshuo Qiu, Aojun Zhou, Pan Lu, Kai-Wei Chang, Peng Gao, Hongsheng Li

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted by ECCV 2024, 46 Pages, Benchmark Project Page: https://mathverse-cuhk.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.06457 2024-08-15 cs.LG cs.AI cs.CL 80%

V-STaR: Training Verifiers for Self-Taught Reasoners

Arian Hosseini, Xingdi Yuan, Nikolay Malkin, Aaron Courville, Alessandro Sordoni, Rishabh Agarwal

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);verifier(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21057 2026-08-28 cs.CL 版本更新 79%

TRACES: Tagging Reasoning Steps for Adaptive Cost-Efficient Early-Stopping

TRACES:用于适应性成本高效提前停止的推理步骤标记

Yannis Belkhiter, Seshu Tirupathi, Giulio Zizzo, John D. Kelleher

机构 * IBM Research Europe(IBM欧洲研究院) Trinity College Dublin(三一学院) ADAPT Research Centre(ADAPT研究中心)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 TRACES通过实时标记推理步骤,实现大语言模型推理的适应性成本高效提前停止,通过监控特定步骤类型提升数学和知识推理任务的效率与准确性。

Comments Accepted at the Third Conference on Language Modeling (COLM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24658 2026-08-26 cs.AI 新提交 79%

Parason: Revealing Subtask and Trial Parallelism in LLM Reasoning

Parason:揭示大语言模型推理中的子任务并行与试错并行

Zhengyang Zhang, Zijian Zhang, Jiaxuan Gao, Shusheng Xu, Yi Wu, Song Han, Ligeng Zhu

机构 * Tsinghua University(清华大学) NVIDIA(英伟达) Massachusetts Institute of Technology(麻省理工学院)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 Parason揭示LLM推理的子任务与试错并行,用上下文无关文法转换轨迹,经PA-GRPO训练,在数学基准上实现约1.7倍加速且保持竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23493 2026-08-25 cs.AI 新提交 79%

SRPO: Self-Reflective Policy Optimization for Long-Horizon Reasoning

SRPO:用于长程推理的自反思策略优化

Jialong Liu, Yuling Shi, Ning Yang, Xiaodong Gu, Zuchao Li

机构 * School of artificial intelligence, Wuhan University(武汉大学人工智能学院) School of computer science, Shanghai Jiao Tong University(上海交通大学计算机科学与工程学院) Institute of automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本研究提出 SRPO 框架,将人类的自反思能力内化到 LLMs 中,无需额外模型即可将稀疏监督转化为密集训练信号,在数学推理等基准上以高数据效率取得了最先进性能。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22048 2026-08-25 cs.AI 新提交 79%

More Accurate or More Efficient? Evaluating Locally Deployed Compact Open-Weight Language Models for Mathematical Reasoning

更准确还是更高效?评估用于数学推理的本地部署紧凑型开放权重语言模型

Orion Powers, Daniella Seum, Khaled Slhoub

机构 * Florida Institute of Technology(佛罗里达理工学院) College of Engineering and Science(工程与科学学院)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出了一种用于评估本地部署语言模型数学推理性能的受控流程,研究三款紧凑型开放权重模型后发现,无单一模型占优,仅靠准确性不足以选择本地模型。

Comments 8 pages, 1 figure, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16554 2026-08-25 cs.CL 版本更新 79%

Ask, Condition or Abstain: Reinforcement Learning for Missing-Premise Reasoning

询问、条件化或弃权:针对缺失前提推理的强化学习

Yongqi Tong, Zhenyu Zhang, Zimi Liu, Kewei Fu, Mingli Song, Haofei Zhang, Junshao Zhang, Hong Zhu, Jiang-Ming Yang, Xin Zhang, Jianshe Li

机构 * Ant International(蚂蚁国际) Zhejiang University(浙江大学) Dingtalk, Alibaba Group(阿里巴巴集团钉钉) Ant Group(蚂蚁集团)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 本研究提出ACA-RL框架,结合MPB基准,训练模型应对缺失前提的推理任务,可询问、条件化或弃权,提升欠定问题处理能力。

Comments Accepted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04617 2026-08-25 cs.AI 版本更新 79%

AdaR: A Framework for Equipping LLMs with Adaptive Reasoning

AdaR:为大语言模型(LLM)配备自适应推理能力的框架

Zhejian Lai, Xiang Geng, Zhijun Wang, Yang Bai, Jiahuan Li, Rongxiang Weng, Jingang Wang, Xuezhi Cao, Xunliang Cai, Shujian Huang

机构 * Nanjing University(南京大学) Meituan Inc.(美团公司)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 针对现有LLM数学推理的鲁棒性与泛化性缺陷,本文提出AdaR框架,通过RLVR训练及数据质量保障方法,有效提升了LLM数学推理能力并缓解了相关缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20717 2026-08-24 cs.AI 新提交 79%

DirEAG: Dirichlet Evidence Aggregation for Calibrating Verbalized Confidence in Mathematical Reasoning

DirEAG:用于校准数学推理中口头表述置信度的Dirichlet证据聚合方法

Haorui Xu, Yuzhou Zhu, Liyuan Gao

机构 * School of Mathematics, Jilin University(吉林大学数学学院) Leicester International Institute, Dalian University of Technology(大连理工大学莱斯特国际学院)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 针对大语言模型数学推理中口头表述置信度难以校准的问题,提出DirEAG方法,将置信度观测值转换为校准软证据,在多个数据集和模型上验证其校准效果优于现有方法。

Comments 16 pages, 3 figures. Code is available at https://github.com/horacehsugithub/DirEAG. Accepted by PRICAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10903 2026-08-24 cs.CL 版本更新 79%

Beyond Gold Standards: Epistemic Ensemble of LLM Judges for Formal Mathematical Reasoning

超越黄金标准:用于形式化数学推理的LLM评判者的认知集成

Lan Zhang, Marco Valentino, Jordan Meadows, Andre Freitas

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 本研究提出基于LLM评判者的认知与形式化基础集成(EFG),用于系统自动评估形式化数学推理中的语句自动形式化任务,实验证实其比粗粒度模型更具适用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19893 2026-08-20 cs.CL 版本更新 79%

Future Policy Approximation for Offline Reinforcement Learning in LLM Reasoning

为离线强化学习未来政策近似改进数学推理

Minjae Oh, Yunho Choi, Dongmin Choi, Yohan Jo

机构 * Graduate School of Data Science, Seoul National University(首尔大学数据科学研究生院)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出未来政策近似方法,通过估计未来策略来优化离线强化学习中的梯度更新,提升长周期推理任务的稳定性与准确性。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15445 2026-08-18 cs.AI 新提交 79%

Measuring Reward Hacking and Reasoning-Answer Decoupling Under Position-Confounded Optimization

测量位置混淆优化下的奖励黑客行为与推理-答案解耦

Suyash Maniyar, Armaan Sandhu, Abhishek Mishra

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 该研究针对位置混淆优化下的奖励黑客与推理-答案解耦问题,通过GRPO训练语言模型,发现模型会学习答案位置捷径,推理与答案解耦,且该捷径可跨域迁移,解耦率等指标可区分能力损失与捷径。

Comments Accepted at the AI Measurement Science Workshop, COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26355 2026-08-12 cs.CL 版本更新 79%

Shorthand for Thought: Compressing LLM Reasoning via Entropy-Guided Supertokens

思维简写:通过熵引导的超令牌压缩LLM推理

Zhenyu Zhao, Sander Land, Daniel M. Bikel, Waseem Alshikh

机构 * Writer, Inc.(Writer公司)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出通过熵引导的超令牌压缩技术,减少LLM推理过程中的计算开销,同时保留推理结构信息,提升可解释性和效率。

Comments Accepted to COLM 2026. Code available at https://github.com/Writer/shorthand-for-thought

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08889 2026-08-11 cs.AI 新提交 79%

LLM Reasoning for Subjective Tasks: Failure Modes, Mitigation, and Dynamic Reasoning Routing

用于主观任务的大语言模型推理:失败模式、缓解措施与动态推理路由

Juncheng Dong, Ding Tong, Ishan Gupta, Yuyan Wang

机构 * Duke University(杜克大学) Netflix(网飞公司)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 该研究针对主观任务中LLM推理的失败模式,提出带条件长度惩罚的后训练算法缓解推理崩溃,还发现推理风格不匹配是主观验证误差主因,给出算法补丁与架构蓝图。

Comments 20th ACM Conference on Recommender Systems (RecSys 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17593 2026-08-11 cs.CL 版本更新 79%

From Chains to DAGs: Probing the Graph Structure of Reasoning in LLMs

从链到DAG:探测语言模型推理中的图结构

Tianjun Zhong, Linyang He, Ziyang Li, Nima Mesgarani

机构 * Columbia University(哥伦比亚大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 研究探讨语言模型内部推理是否以有向无环图形式存在,通过设计探针验证DAG结构在各层的出现,并发现中间层具有最强的结构恢复能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18077 2026-08-11 cs.CL 版本更新 79%

Sparks of Cooperative Reasoning: LLMs as Strategic Hanabi Agents

合作推理的火花:LLMs作为战略汉诺塔代理

Mahesh Ramesh, Kaousheik Jayakumar, Aswinkumar Ramkumar, Pavan Thodima, Aniket Rege, Emmanouil-Vasileios Vlatakis-Gkaragkounis

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 本文研究了在不完全信息下多智能体系统的合作推理挑战,通过汉诺塔游戏评估不同LLM模型在策略沟通和状态跟踪中的表现,展示了模型在协作游戏中的改进效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05940 2026-08-11 cs.CL 版本更新 79%

R3S: Refining and Recovering Reinforcement Signals for Multilingual Understanding and Reasoning

通过翻译-推理联合训练实现自我改进的多语言长推理

Junxiao Liu, Zhijun Wang, Yixiao Li, Zhejian Lai, Liqian Huang, Xin Huang, Xue Han, Junlan Feng, Shujian Huang

机构 * National Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家重点实验室,南京大学) University of Tübingen(图宾根大学) China Mobile Communications Company Limited Research Institute(中国移动通信集团有限公司研究院)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 TRIT通过整合翻译训练提升多语言长推理能力,在MMATH上超越基线7个百分点,提升答案正确性和语言一致性。

Comments 16 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19990 2026-08-11 cs.LG 版本更新 79%

Rethinking Reasoning with MDLMs: Early Exits, Post-hoc Reasoning, and Beyond

重新思考MDLM的推理:早期退出、事后推理及其他

Zachary Horvitz, Raghav Singhal, Hao Zou, Carles Domingo-Enrich, Zhou Yu, Rajesh Ranganath, Kathleen McKeown

机构 * Columbia University(哥伦比亚大学) Department of Computer Science, New York University(纽约大学计算机科学系) Microsoft Research(微软研究院) Center for Data Science, New York University(纽约大学数据科学中心)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.LG

AI总结 本文提出“推理即填充”技术,基于掩码扩散语言模型(MDLMs)实现早期退出、事后推理等能力,在GSM8k数据集上微调LLaDA-8B-Base提升准确率14.9%,证明MDLM训练目标对推理有显著优势。

Comments COLM 2026 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06243 2026-08-10 cs.AI 版本更新 79%

DASH: Divergence-Adaptive Supervision Horizons for On-Policy Self-Distillation of Reasoning Models

DASH:用于推理模型在线自蒸馏的 divergence-adaptive 监督视界

ZhiYan Hou, Xinyu Tang, Hongyan An, Jianjin Zhang, Weizhen Wang, Yunyun Han, Gengsheng Li, Xiangzhao Hao, Haiyun Guo, Wenbin Hu, Jinqiao Wang, Yafeng Deng

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 针对标准在线自蒸馏(OPSD)未充分利用 rollout 时间结构的局限,提出 DASH 方法,通过自适应传播门调整 token 级监督权重,在三类数学推理基准、三种模型规模上均优于 vanilla OPSD,且无需额外前向传播。

Comments 17 pages, 4 figures, 9 tables. Code at https://github.com/DBtxy/DASH-OPSD

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19932 2026-08-10 cs.CL cs.SD 版本更新 79%

Efficient Chain-of-Modality Reasoning via Progressive Compression for Spoken Language Models

通过渐进压缩实现口语语言模型的高效模态链推理

Pengchao Feng, Chao-Hong Tan, Qian Chen, Wen Wang, Xiangang Li, Xie Chen

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) Token Foundry, Alibaba Group(阿里巴巴集团淘系技术)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 针对口语语言模型推理能力落后问题,提出高效模态链推理(ECoM推理),通过压缩文本组件提高推理准确性,并用渐进压缩策略训练,实验显示其在口语数学问答基准测试中,增强推理且保持效率,准确率提升显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06756 2026-08-10 cs.CL 版本更新 79%

How Long Reasoning Chains Influence LLMs' Judgment of Answer Factuality

推理链长度如何影响LLM对答案事实性的判断

Minzhu Tu, Shiyu Ni, Keping Bi

机构 * State Key Laboratory of AI Safety(人工智能安全国家重点实验室) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学) Beijing University of Post and Telecommunications(北京邮电大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 研究探讨了推理链对LLM判断答案事实性的影响,发现弱判官易受推理存在影响,而强判官部分利用推理作为证据,但仍易被高质量推理链误导。

Comments ACL2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06347 2026-08-07 cs.CL 新提交 79%

RP-OPSD: Reasoning-Pivot-Guided On-Policy Self-Distillation for Multilingual Reasoning Transfer

RP-OPSD:基于推理枢轴引导的多语言推理迁移在线策略自蒸馏

Xinye Wang, Junxiao Liu, Shujian Huang

机构 * Nanjing University(南京大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 该研究针对多语言推理迁移中现有在线策略自蒸馏未优先考虑关键推理信号的问题,提出 RP-OPSD 方法,利用教师视图分布偏移引导特权蒸馏,在 17 种语言的数学推理基准上优于基线,提升了多语言推理能力。

Comments 16 pages. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05541 2026-08-07 cs.AI 新提交 79%

Hyper-ES: Effective Evolution Strategies for LLM Reasoning via Descent Direction Merging

Hyper-ES:通过下降方向合并实现LLM推理的有效进化策略

Yu Gu, Zhi Zheng, Yunpeng Ba, Xialiang Tong, Mingxuan Yuan, Zhenkun Wang

机构 * Southern University of Science and Technology(南方科技大学) National University of Singapore(新加坡国立大学) Nanjing University(南京大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出Hyper-ES框架,通过梯度微调获取下降方向张成子空间,再用CMA-ES优化DARE-TIES合并系数,在数学推理任务上性能优于GRPO-LoRA,梯度更新量减少10%。

Comments 19 pages, 4 figures, 14 tables. Code: https://github.com/kuangrepi/Hyper-ES

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18842 2026-08-06 cs.CL cs.CV 79%

v1: Learning to Point Visual Tokens for Multimodal Grounded Reasoning

v1: 为多模态 grounded 推理学习指向视觉标记

Jiwan Chung, Junhyeok Kim, Siyeol Kim, Jaeyoung Lee, Min Soo Kim, Youngjae Yu

机构 * Yonsei University(延世大学) Seoul National University(首尔国立大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 v1通过点对复制机制实现轻量级的主动视觉引用,提升多模态推理中视觉证据与推理空间的对齐性,优于现有基线模型。

Journal ref COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏