arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-02-02 至 2026-02-02 共收录 16 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 16 篇

2601.23027 2026-02-02 cs.LG 89%

Divide-and-Conquer CoT: RL for Reducing Latency via Parallel Reasoning

分而治之的CoT:通过并行推理减少延迟的强化学习

Arvind Mahankali, Kaiyue Wen, Tengyu Ma

专题命中 数学推理 :reasoning(title,abstract);CoT(title,abstract);chain-of-thought(abstract);分类 cs.LG

AI总结 通过并行推理和强化学习,DC-CoT在减少延迟的同时保持高精度,适用于数学推理任务。

Comments 47 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15522 2026-02-02 cs.CL 83%

LLM Latent Reasoning as Chain of Superposition

LLM潜在推理作为叠加链

Jingcheng Deng, Liang Pang, Zihao Wei, Shicheng Xu, Zenghao Duan, Kun Xu, Yang Song, Huawei Shen, Xueqi Cheng

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences, Beijing, China(人工智能安全国家重点实验室,计算技术研究所,中国科学院,北京) University of Chinese Academy of Sciences, Beijing, China(中国科学院大学,北京)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 本文提出Latent-SFT框架,通过约束隐藏状态、构建语义紧凑的链结构以及使用随机Gumbel-Softmax优化,实现LLM潜在推理的高效叠加,提升数学基准任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23133 2026-02-02 cs.AI 79%

RAudit: A Blind Auditing Protocol for Large Language Model Reasoning

RAudit: 一种用于大语言模型推理的盲审协议

Edward Y. Chang, Longling Geng

机构 * Stanford University(斯坦福大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 RAudit通过盲审协议检测大语言模型推理中的问题,揭示了四个导致模型不可靠的机制,挑战了能力与鲁棒性之间的关系。

Comments 24 pages, 21 tables, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00459 2026-02-02 cs.AI 79%

Thinking Machines: Mathematical Reasoning in the Age of LLMs

思考机器:在大语言模型时代中的数学推理

Andrea Asperti, Alberto Naibo, Claudio Sacerdoti Coen

机构 * Department of Informatics--- Science and Engineering (DISI), University of Bologna(信息科学与工程系(DISI),博洛尼亚大学) Department of Philosophy, University Paris 1 Panthéon-Sorbonne(哲学系,巴黎第一大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文探讨了大语言模型在数学推理中的现状,分析了传统数学与形式化数学的差异,以及证明合成与代码生成的对比,旨在明确当前系统的局限性并指出未来发展方向。

Journal ref Big Data and Cognitive Computing, 2026, 10(1), 38

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11062 2026-02-02 cs.LG cs.MA 70%

Stronger-MAS: Multi-Agent Reinforcement Learning for Collaborative LLMs

Stronger-MAS: 多智能体强化学习用于协作大语言模型

Yujie Zhao, Lanxiang Hu, Yang Wang, Minmin Hou, Hao Zhang, Ke Ding, Jishen Zhao

机构 * University of California, San Diego(加州大学圣地亚哥分校) Intel Corporation(英特尔公司)

专题命中 数学推理 :reasoning(abstract);planning(abstract);分类 cs.LG

AI总结 Stronger-MAS提出了一种针对多智能体强化学习的AT-GRPO算法,通过改进的分组策略和训练系统,在多个任务中显著提升了大语言模型的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09026 2026-02-02 cs.LG cs.CR 70%

Detecting Instruction Fine-tuning Attacks using Influence Function

利用影响函数检测指令微调攻击

Jiawei Li

机构 * Tsinghua University(清华大学)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.LG

AI总结 本文提出一种无需先验知识的检测方法,通过影响函数和语义转换识别污染示例,提升模型鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23149 2026-02-02 cs.SD 67%

Hearing is Believing? Evaluating and Analyzing Audio Language Model Sycophancy with SYAUDIO

听信还是不信?评估和分析音频语言模型的趋炎附势行为 with SYAUDIO

Junchi Yao, Lokranjan Lakshmikanthan, Annie Zhao, Danielle Zhao, Shu Yang, Zikang Ding, Di Wang, Lijie Hu

机构 * University of Electronic Science and Technology of China(电子科技大学) Mohamed bin Zayed University of Artificial Intelligence(Mohamed bin Zayed人工智能大学) King Abdullah University of Science and Technology(卡布斯大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract)

AI总结 SYAUDIO是首个评估音频语言模型趋炎附势行为的基准,通过系统分析不同领域和条件下的趋炎附势现象,验证了监督微调在减少此类行为中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22628 2026-02-02 cs.LG cs.AI cs.CL 67%

TTCS: Test-Time Curriculum Synthesis for Self-Evolving

TTCS: 测试时课程合成用于自演化

Chengyi Yang, Zhishang Xiang, Yunbo Tang, Zongpei Teng, Chengsong Huang, Fei Long, Yuhan Liu, Jinsong Su

机构 * Xiamen University(厦门大学) Washington University in St. Louis(华盛顿大学圣路易斯分校) Renmin University of China(中国人民大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 TTCS通过共进化框架提升LLM推理能力,利用生成器和求解器的协同进化,动态构建测试时课程以增强模型性能。

Comments 10 pages, 4 figures, Our code and implementation details are available at https://github.com/XMUDeepLIT/TTCS

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22718 2026-02-02 cs.AI cs.LG 62%

A Step Back: Prefix Importance Ratio Stabilizes Policy Optimization

后退一步:前缀重要性比率稳定了策略优化

Shiye Lei, Zhihao Cheng, Dacheng Tao

机构 * The University of Sydney(悉尼大学) ByteDance(字节跳动) Nanyang Technological University(南洋理工大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出MinPRO目标,通过使用非累积的最小token级比率替代累积前缀比率,以稳定LLM在非策略性条件下的训练和优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22432 2026-02-02 cs.LG cs.CL 62%

ReNCE: Learning to Reason by Noise Contrastive Estimation

ReNCE: 通过噪声对比估计学习推理

Wenzheng Zhang, Karl Stratos

机构 * Rutgers University(罗杰斯大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 ReNCE通过噪声对比估计学习提升大语言模型的推理能力,采用显式对比学习方法在数学基准测试中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21282 2026-02-02 cs.LG cs.AI 62%

It's Not You, It's Clipping: A Soft Trust-Region via Probability Smoothing for LLM RL

并非你,而是剪裁:通过概率平滑的软信任区域进行大语言模型强化学习

Madeleine Dwyer, Adam Sobey, Adriane Chapman

机构 * University of Southampton(索姆塞特大学) The Alan Turing Institute(艾伦·图灵研究所)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出PSPO方法,通过概率平滑改进大语言模型强化学习中的信任区域,提升数学推理任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23135 2026-02-02 cs.LG 57%

Why GRPO Needs Normalization: A Local-Curvature Perspective on Adaptive Gradients

为何GRPO需要规范化:从局部曲率角度探讨自适应梯度

Cheng Ge, Caitlyn Heqi Yin, Hao Liang, Jiawei Zhang

机构 * Department of Aeronautics and Astronautics, MIT(麻省理工学院航空与宇航系) Department of Statistics, University of Wisconsin--Madison(威斯康星大学麦迪逊分校统计系) Department of Informatics, King's College London(伦敦国王学院信息学系) Department of Computer Sciences, University of Wisconsin--Madison(威斯康星大学麦迪逊分校计算机科学系)

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 GRPO中标准差规范化通过局部曲率视角解释了其自适应梯度机制,理论和实验表明规范化能提升收敛速度并优化训练阶段表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23006 2026-02-02 cs.CL 57%

InstructDiff: Domain-Adaptive Data Selection via Differential Entropy for Efficient LLM Fine-Tuning

InstructDiff:通过微分熵实现领域自适应的数据选择以实现高效的LLM微调

Junyou Su, He Zhu, Xiao Luo, Liyu Zhang, Hong-Yu Zhou, Yun Chen, Peng Li, Yang Liu, Guanhua Chen

机构 * Peking University(北京大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Tsinghua University(清华大学) SUFE(上海财经大学) SUSTech(南方科技大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 InstructDiff通过微分熵实现领域自适应的数据选择,提升LLM微调效率,实验显示在数学推理和通用指令遵循任务上分别提高17%和52%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19439 2026-02-02 cs.CL 57%

Surrogate Signals from Format and Length: Reinforcement Learning for Solving Mathematical Problems without Ground Truth Answers

从格式和长度获取代理信号:用于无真实答案解决数学问题的强化学习

Rihui Xin, Han Liu, Zecheng Wang, Yupeng Zhang, Dianbo Sui, Xiaolin Hu, Bingning Wang

机构 * Baichuan Inc(百川公司) Tsinghua University(清华大学) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 本研究提出利用格式和长度作为代理信号,通过强化学习提升数学问题解决性能,无需真实答案,实现高效推理优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15172 2026-02-02 cs.AI 57%

Self-Improvement of Language Models by Post-Training on Multi-Agent Debate

通过多智能体辩论进行语言模型的自改进

Ankur Samanta, Akshayaa Magesh, Runzhe Wu, Ayush Jain, Youliang Yu, Daniel Jiang, Boris Vidolov, Paul Sajda, Yonathan Efroni, Kaveh Hassani

机构 * Meta AI Columbia University(哥伦比亚大学) Meta Superintelligence Labs(Meta超智能实验室)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 通过多智能体辩论和强化学习提升语言模型的自我改进能力,实现推理准确性、自洽性和泛化能力的提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22405 2026-02-02 math.OC 50%

Visibility in Polygonal Environments with Holes: Finding Best Spots for Hiding and Surveillance

多孔多边形环境中可见性研究:寻找最佳隐藏与监视位置

Neilabh Banzal, Jorge Cortés, Sonia Martínez

专题命中 数学推理 :reasoning(abstract)

AI总结 本文提出了一种归一化下降算法,用于在多孔多边形环境中寻找最优隐藏或监视位置,通过非光滑分析和随机性处理非凸度量问题,确保高概率收敛到局部极小值。

详情

展开后加载摘要…

URL PDF HTML 收藏