arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-07-31 至 2026-07-31 共收录 15 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 15 篇

2607.27888 2026-07-31 cs.AI 新提交 92%

Not All Tokens Deserve Equal Credit: Counterfactual Sensitivity Credit Reallocation for Long-CoT Reasoning

并非所有 token 都应获得同等权重:面向长思维链(Long-CoT)推理的反事实敏感性权重重分配

Qiangqiang He, Zhongheng Wu, ZiJian Wang

机构 * State Key Laboratory for Novel Software Technology, Nanjing University(南京大学现代软件技术国家重点实验室) Institute of Wireless Communications Technology, Shanghai Jiao Tong University(上海交通大学无线通信技术研究所)

专题命中 数学推理 :CoT(title,title_cn);reasoning(title,abstract);verifier(abstract);分类 cs.AI

AI总结 针对长思维链推理中均匀分配 token 权重的缺陷,提出反事实敏感性权重重分配方法,在数学推理基准上优于 GRPO,验证了特权诱导方向不可靠的诊断。

Comments 20 pages, 6 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27631 2026-07-31 cs.AI cs.CL 新提交 81%

ReDiPPO: Reference-Guided Value Calibration and Discrepancy-Aware Token Reweighting for Mathematical Reasoning

ReDiPPO:用于数学推理的参考引导值校准与差异感知标记重加权

Zhenrong Zhang, Fei Wu, Jun Du, Jianshu Zhang, Si Wei

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 针对数学推理中PPO的标记级信用分配难题,ReDiPPO引入参考引导评判器并通过值估计差异重加权标记优势,提升值估计精度且优于PPO、DAPO等基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28449 2026-07-31 cs.CL 新提交 79%

Lightning OPD 2.0: Mitigating Style Bias in Cross-Teacher On-Policy Distillation for Large Reasoning Models

Lightning OPD 2.0:缓解大型推理模型跨教师在线策略蒸馏中的风格偏差

Yecheng Wu, Song Han, Han Cai

机构 * NVIDIA(英伟达)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 Lightning OPD 2.0通过交叉拟合风格残差化缓解大型推理模型跨教师在线策略蒸馏的风格偏差,在数学推理与代码生成基准中优于原方法,实现了跨教师设置下的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27484 2026-07-31 cs.AI cs.MA 新提交 79%

Skill Use or Skill Theater? Evaluating the Reasoning Backroom in Skill-Augmented Language Agents

技能使用还是技能表演?评估技能增强型语言智能体中的推理后台

Jinwei Hu, Yi Qi, Xinmiao Huang, Youcheng Sun, Yi Dong, Xiaowei Huang

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本研究针对技能增强型语言智能体,提出BACKTRACE评估框架及BACKROOMBench测试平台,发现其存在推理后台现象,即技能使用声明与实际决策影响存在系统性差距,需通过干预进行审计。

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28421 2026-07-31 cs.AI 版本更新 79%

DenoiseRL: Bootstrapping Reasoning Models to Recover from Noisy Prefixes

DenoiseRL:引导推理模型从噪声前缀中恢复

Caijun Xu, Changyi Xiao, Zhongyuan Peng, Yixin Cao

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 提出DenoiseRL框架,通过强化学习从弱模型的错误推理中学习,无需外部监督或强教师模型,提升推理性能和训练效率。

Comments 17 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27610 2026-07-31 cs.LG 新提交 77%

Kalman Meets Curriculum: Efficient Dynamic Prompt Selection for Adaptive RL Finetuning

卡尔曼与课程学习结合:面向自适应RL微调的高效动态提示选择

Haodong Zhu, Yangyang Ren, Yanjing Li, Sheng Xu, Haiguang Liu, Linlin Yang, Baochang Zhang

机构 * Beihang University(北京航空航天大学) Zhongguancun Academy(中关村学院) Nanyang Technological University(南洋理工大学) Communication University of China(中国传媒大学)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);planning(abstract);分类 cs.LG

AI总结 本文提出KGPS方法,将提示选择转化为动态状态估计问题,适配RL训练动态,在多推理基准和RL算法上较基线提升准确率与rollout效率,在在线提示选择中达最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27705 2026-07-31 cs.AI cs.LG 新提交 73%

Albilich: Steerable Proof-State Orchestration for LLM-Based Mathematical Research with CAS Integration

Albilich:用于结合计算机代数系统(CAS)的基于大语言模型的数学研究的可操控证明状态编排工具

Ting Gong, Michael Ruofan Zeng, Yong Yang

专题命中 数学推理 :reasoning(abstract);verifier(abstract);分类 cs.AI、cs.LG

AI总结 Albilich是结合CAS等功能的开源数学自主研究智能体框架,在RealMath基准和Kourovka开放问题上取得优异效果,可实现AI辅助的可扩展数学研究。

Comments 7 pages, comments welcome!

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27787 2026-07-31 cs.LG cs.AI 新提交 62%

LoRA Scaffolded Policy Optimization (LSPO): A Sampling-Time Low-Rank Scaffold for Recovering Reinforcement-Learning Gradient on Zero-Reward Cliff Prompts

LoRA 支架策略优化(LSPO):零奖励悬崖提示下恢复强化学习梯度的采样时低秩支架

Ken Ding

机构 * NVIDIA(英伟达)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 针对数学推理 RLVR 的悬崖提示梯度丢失问题,提出 LSPO 采样时机制,通过 LoRA 适配器恢复梯度,在 DeepMath-103K 数据集上 16 项基准指标均优于 DAPO,平均提升 3.8 分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03126 2026-07-31 cs.LG cs.AI 版本更新 62%

ACPO: Asymmetric Credit Policy Optimization via Mode-Local Entropy Surrogate

ACPO:通过细粒度替代熵实现自适应信用策略优化

Zijun Xie, Yuyang You, Yongzhi Li, Enlei Gong, Quan Chen, Yanhua Cheng, Peng Jiang, Binbin Zheng, Xiaolong Liu, Zeyu Chen, Yadong Mu

机构 * Peking University(北京大学) Baidu Inc.(百度公司) Kuaishou Inc(快手公司)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 研究针对强化学习中稀疏奖励致令牌级信用分配难的问题,提出基于模式局部替代熵的ACPO框架,通过不对称调制策略更新改进信用分配,实验表明其优于多种强化学习基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28582 2026-07-31 cs.LG 新提交 57%

$β$-OPSD: Deriving with Policy Optimization, Training with Self-Distillation

β-OPSD:基于策略优化推导,采用自蒸馏训练

Jiawei Xu, Minghui Liu, Juzheng Zhang, Tom Goldstein, Furong Huang

机构 * University of Maryland(马里兰大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 β-OPSD是将普通OPSD扩展为含可控正则化参数β的策略优化通用形式,通过蒸馏近似策略优化解,在数学推理基准上性能与稳定性均优于普通OPSD。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28077 2026-07-31 cs.CL 新提交 57%

LEEPS: Latent-Guided Explore-Exploit Prompt Sampling for Efficient RLVR in Large Language Models

LEEPS:用于大语言模型中高效RLVR的潜在引导探索-利用提示采样

Shuang Liang, Haoyang Zhou, Yifan Gong, Guowei Wang, Xiting Wang

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 LEEPS是一种潜在引导探索-利用提示采样器,通过自适应分配rollout预算等方式优化提示采样,在6个数学推理基准和3个OOD通用推理基准上均取得最优性能,且训练开销较小。

Comments 15pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27994 2026-07-31 cs.AI 新提交 57%

SKIMIX: Multi-Agent Harness-Time Scaling with Skill Mixture for Dynamic Harness Engineering

SKIMIX:面向动态 harness 工程的技能混合多智能体 harness 时间缩放方法

Jia Luo

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 SKIMIX 是一种多智能体框架,结合技能检索、抗稀释路由等技术,在六个推理基准上提升开放式数学推理能力,为可扩展智能体设计提供了任务特性相关的实用指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27709 2026-07-31 cs.AI 新提交 57%

MECA: A Mechanism-Centered Agent for Constructing Well-Specified and Valuable Mathematical Conjectures

MECA:一种以机制为中心的智能体,用于构建定义明确且有价值的数学猜想

Wentao Long, Yunfei Zhang, Chenyi Li, Zaiwen Wen

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 MECA是一种以机制为中心的多智能体框架,可联合构建候选数学命题及其支撑机制,能生成定义明确且有研究价值的猜想,相关猜想对现有自动证明器仍具挑战性。

Comments 78 pages, 5 figures. Includes appendices and the full collection of 100 generated conjectures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16140 2026-07-31 cs.LG 版本更新 57%

Noisy Data is Destructive to Reinforcement Learning with Verifiable Rewards

具有可验证奖励的强化学习中噪声数据是破坏性的

Yuxuan Zhu, Daniel Kang

机构 * Siebel School of Computing and Data Science, University of Illinois Urbana Champaign, USA(计算机与数据科学学院,伊利诺伊大学厄巴纳-香槟分校)

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 研究指出,现有RLVR算法无法缓解噪声影响,噪声会破坏强化学习性能,真实世界噪声导致Text2SQL任务准确率下降5-12%。

Comments 16 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18538 2026-07-31 cs.CR 版本更新 50%

CryptanalysisBench: Can LLMs do Cryptanalysis?

密码分析基准测试:大语言模型能进行密码分析吗?

Lukas Fluri, Avital Shafran, Nicholas Carlini, Matthew Jagielski, Milad Nasr, Orr Dunkelman, Eyal Ronen, Florian Tramèr

专题命中 数学推理 :reasoning(abstract)

AI总结 研究探讨大语言模型能否进行密码分析,引入包含六个密码原语家族191个任务的CryptanalysisBench基准测试,五个前沿模型在不同层级有一定破解率,不仅得出已知结果还产生新成果,发布该基准测试以追踪人工智能密码分析进展及压力测试候选方案。

Comments 46 pages, 5 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏