arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-01-08 至 2026-01-08 共收录 9 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 9 篇

2511.08525 2026-01-08 cs.CL 89%

Investigating CoT Monitorability in Large Reasoning Models

探究大型推理模型中的CoT可监控性

Shu Yang, Junchao Wu, Xilin Gong, Xuansheng Wu, Derek Wong, Ninghao Liu, Di Wang

机构 * Provable Responsible AI and Data Analytics (PRADA) Lab(可证明负责任的人工智能与数据分析师实验室) King Abdullah University of Science and Technology(卡布斯大学) University of Georgia(佐治亚大学) University of Macau(澳门大学)

专题命中 数学推理 :reasoning(title,abstract);CoT(title,abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 本文探讨了大型推理模型中CoT可监控性的挑战与潜力,提出MoME范式以通过CoT监控其他模型的误行并提供结构化判断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19640 2026-01-08 cs.CL 87%

Interleaved Reasoning for Large Language Models via Reinforcement Learning

通过强化学习实现大型语言模型的交错推理

Roy Xie, David Qiu, Deepak Gopinath, Dong Lin, Yanchao Sun, Chong Wang, Saloni Potdar, Bhuwan Dhingra

机构 * Apple(苹果公司) Duke University(杜克大学)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);logical reasoning(abstract)

AI总结 通过强化学习实现大型语言模型的交错推理,提升推理效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21318 2026-01-08 cs.AI 85%

Beyond Chemical QA: Evaluating LLM's Chemical Reasoning with Modular Chemical Operations

超越化学问答:利用模块化化学操作评估LLM的化学推理

Hao Li, He Cao, Bin Feng, Yanjun Shao, Xiangru Tang, Zhiyuan Yan, Li Yuan, Yonghong Tian, Yu Li

机构 * Pengcheng Laboratory(鹏城实验室) International Digital Economy Academy(国际数字经济学院) School of Electronic and Computer Engineering, Peking University(北京大学电子与计算机工程学院) School of AI for Science, Peking University(北京大学科学人工智能学院) Yale University(耶鲁大学)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI

AI总结 本文提出ChemCoTBench框架,通过模块化化学操作评估LLM在化学推理中的能力,解决分子优化和反应预测等复杂任务。

Comments Accepted by NeurIPS 2025 Dataset Track, 22 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03823 2026-01-08 cs.CL 83%

Step Potential Advantage Estimation: Harnessing Intermediate Confidence and Correctness for Efficient Mathematical Reasoning

阶梯势能优势估计:利用中间置信度和正确性以实现高效的数学推理

Fei Wu, Zhenrong Zhang, Qikai Chang, Jianshu Zhang, Quan Liu, Jun Du

机构 * University of Science and Technology of China(中国科学技术大学) iFLYTEK Research(iFLYTEK研究院)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 本文提出阶梯势能优势估计(SPAE)方法,通过提取中间置信度和正确性,实现高效数学推理的细粒度信用分配。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03822 2026-01-08 cs.AI 79%

ROI-Reasoning: Rational Optimization for Inference via Pre-Computation Meta-Cognition

ROI-Reasoning: 为推理的理性优化 via 预计算元认知

Muyang Zhao, Qi Qi, Hao Sun

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 ROI-Reasoning通过预计算元认知,为LLMs提供预算感知的理性优化,提升推理性能并减少计算资源浪费。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03661 2026-01-08 cs.LG cs.AI 62%

AMIR-GRPO: Inducing Implicit Preference Signals into GRPO

AMIR-GRPO:将隐式偏好信号引入GRPO

Amir Hossein Yari, Fajri Koto

机构 * Department of Natural Language Processing, MBZUAI(自然语言处理系,MBZUAI)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 AMIR-GRPO通过隐式对比正则化器提升GRPO性能,增强低奖励轨迹抑制,减少长度偏差,实现更密集的监督约束。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03320 2026-01-08 cs.LG cs.AI 62%

Ratio-Variance Regularized Policy Optimization for Efficient LLM Fine-tuning

基于比率方差正则化的策略优化用于高效的LLM微调

Yu Luo, Shuo Han, Yihan Hu, Dong Li, Jianye Hao

机构 * Department of Foundation Model, 2012 Labs, Huawei(华为2012实验室基础模型部门) College of Intelligence and Computing, Tianjin University(天津大学智能与计算学院)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 R²VPO通过正则化策略比率的方差,提升LLM微调的稳定性和数据效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11184 2026-01-08 cs.LG cs.CL 62%

Reinforcement Learning for Tool-Integrated Interleaved Thinking towards Cross-Domain Generalization

强化学习用于工具集成的交叉领域泛化思考

Zhengyu Chen, Jinluan Yang, Teng Xiao, Ruochen Zhou, Luan Zhang, Xiangyu Xi, Xiaowei Shi, Wei Wang, Jinggang Wang

机构 * Meituan(美团) Zhejiang University(浙江大学) Allen Institute for Artificial Intelligence(人工智能算法研究所) City University of Hong Kong(香港城市大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出RITE方法,通过强化学习和交叉领域工具执行,提升LLM在跨领域推理中的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03723 2026-01-08 cs.LG 57%

ETR: Outcome-Guided Elastic Trust Regions for Policy Optimization

ETR: 以结果为导向的弹性信任区域用于策略优化

Shijie Zhang, Kevin Zhang, Zheyuan Gu, Xiang Guo, Rujun Guo, Shaoyu Liu, Guanjun Jiang, Xiaozhao Wang

机构 * Alibaba Group(阿里巴巴集团) Peking University(北京大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 ETR通过动态信任区域机制,提升策略优化的信号利用效率和探索稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏