arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 45335 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 3246 篇

2505.16646 2026-04-21 cs.AI 57%

SMART: Self-Generating and Self-Validating Multi-Dimensional Assessment for LLMs' Mathematical Problem Solving

SMART: 自生成和自验证的多维评估用于LLM的数学问题解决

Yujie Hou, Mei Wang, Yaoyao Zhong, Ting Zhang, Xuetao Ma, Hua Huang

机构 * School of Artificial Intelligence, Beijing Normal University(北京师范大学人工智能学院) Beijing Key Laboratory of Artificial Intelligence for Education Engineering Research Center of Intelligent Technology and Educational Application, Ministry of Education(北京市教育厅人工智能教育工程研究中心智能技术与教育应用联合实验室)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 SMART通过分解数学问题解决为四个维度,评估LLM的数学能力,揭示模型在不同维度上的差异,提出All-Pass Score衡量真实问题解决能力。

Comments Need to address additional data or methodological concerns

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17501 2026-04-21 cs.CL 57%

CoAct: Co-Active LLM Preference Learning with Human-AI Synergy

CoAct:基于人机协同的LLM偏好学习

Ruiyao Xu, Mihir Parmar, Tiankai Yang, Zhengyu Hu, Yue Zhao, Kaize Ding

机构 * Northwestern University(西北大学) Google(谷歌) University of Southern California(南加州大学) University of Washington(华盛顿大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出CoAct框架,通过策略性的人机协作结合自奖励与主动学习,提升LLM在不同任务中的对齐效果,在三个推理基准测试中取得显著提升。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05760 2026-04-21 cs.CL 57%

Writing-RL: Advancing Long-form Writing via Adaptive Curriculum Reinforcement Learning

Writing-RL: 通过自适应课程强化学习推进长文本写作

Xuanyu Lei, Chenliang Li, Yuning Wu, Kaiming Liu, Weizhou Shen, Peng Li, Ming Yan, Fei Huang, Ya-Qin Zhang, Yang Liu

机构 * Institute for AI Industry Research (AIR)(人工智能产业研究院) Tsinghua University(清华大学) Dept. of Comp. Sci. & Tech.(计算机科学与技术系) Institute for AI(人工智能研究院) Institute of Intelligent Computing(智能计算研究院) Alibaba Group(阿里巴巴集团)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出Writing-RL框架,通过自适应课程强化学习提升长文本写作能力,克服SFT的局限,实验表明其在长文本生成任务中优于基线模型。

Comments Code is released at https://github.com/Tongyi-Zhiwen/Writing-RL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09536 2026-04-21 cs.CL 57%

Evaluating Robustness of Large Language Models Against Multilingual Typographical Errors

评估大型语言模型对多语言拼写错误的鲁棒性

Raoyuan Zhao, Yihong Liu, Lena Altinger, Hinrich Schütze, Michael A. Hedderich

机构 * Center for Information and Language Processing(信息与语言处理中心) LMU Munich(慕尼黑大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心(MCML))

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出MulTypo算法,评估18种开源LLM在多语言拼写错误下的表现,发现拼写错误显著降低性能,尤其在生成任务和推理任务中,且语言和任务类型影响鲁棒性,强调需关注噪声训练和多语言鲁棒性评估。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26109 2026-04-17 cs.LG 57%

Do Not Step Into the Same River Twice: Learning to Reason from Trial and Error

不要踏进同一条河两次:从试错中学习推理

Chenming Tang, Hsiu-Yuan Huang, Weijie Liu, Clive Bai, Saiyong Yang, Yunfang Wu

机构 * National Key Laboratory for Multimedia Information Processing(国家多媒体信息处理重点实验室) School of Computer Science(计算机学院) LLM Department, Tencent(腾讯LLM部门)

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出LTE方法,通过提示模型自身之前的错误来提升推理能力,优于传统方法并在多个数学推理基准上表现更佳。

Comments Accepted to ACL 2026 (main conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13902 2026-04-16 cs.LG 57%

DiPO: Disentangled Perplexity Policy Optimization for Fine-grained Exploration-Exploitation Trade-Off

DiPO:解耦 perplexity 的策略优化用于细粒度探索-利用平衡

Xiaofan Li, Ming Yang, Zhiyuan Ma, Shichao Ma, Jintao Du, Yu Cheng, Weiqiang Wang, Zhizhong Zhang, Xin Tan, Yanyun Qu, Lizhuang Ma, Yuan Xie

机构 * East China Normal University(东华师范大学) Ant Group(蚂蚁集团) Shanghai Innovation Institute(上海创新研究院) Xiamen University(厦门大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出 DiPO 方法,通过解耦 perplexity 空间来优化探索与利用的平衡,提升 LLM 在数学推理和函数调用任务中的性能。

Comments LLM Reinforce Learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26519 2026-04-16 cs.LG 57%

Think Outside the Policy: In-Context Steered Policy Optimization

突破政策限制:基于上下文的政策优化

Hsiu-Yuan Huang, Chenming Tang, Weijie Liu, Clive Bai, Saiyong Yang, Yunfang Wu

机构 * National Key Laboratory for Multimedia Information Processing(国家多媒体信息处理重点实验室) School of Computer Science(计算机学院) LLM Department(大模型部门) Tencent(腾讯)

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出ICPO框架,利用大推理模型的上下文学习能力,通过混合策略GRPO和隐式专家强制扩展探索范围,提升RLVR在数学推理任务中的性能和稳定性。

Comments ACL 2026 Findings. 19 pages, 13 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04256 2026-04-13 cs.CL 57%

SSPO: Subsentence-level Policy Optimization

SSPO:子短语级策略优化

Kun Yang, Zikang chen, Yanmeng Wang, Zhigen Li, Ning Cheng, Shaojun Wang, Jing Xiao

机构 * Ping An Technology(平安科技) TJUNLP Lab, Tianjin University(天津大学TJUNLP实验室)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 SSPO在子短语层面计算重要性比率,平衡GRPO与GSPO的优劣,缓解训练崩溃和方差问题,同时避免整个响应被保留导致的不稳定更新。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04418 2026-04-10 cs.HC cs.AI 57%

Justified or Just Convincing? Error Verifiability as a Dimension of LLM Quality

合理还是有说服力?错误可验证性作为LLM质量的一个维度

Xiaoyuan Zhu, Kimberly Le Truong, Riccardo Fogliato, Gokul Swamy, Weijian Zhang, Minglai Yang, Longtian Ye, Bangya Liu, Minghao Liu, Andrew Ilyas, Steven Wu

机构 * University of Southern California(南加州大学) Carnegie Mellon University(卡内基梅隆大学) Microsoft Core AI(微软核心人工智能)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出错误可验证性作为LLM质量的新维度,通过实验发现传统方法无法提升该维度,引入两种方法提升可验证性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03647 2026-04-09 cs.CV cs.AI 57%

Stabilizing Unsupervised Self-Evolution of MLLMs via Continuous Softened Retracing reSampling

通过连续软化回溯重采样稳定多模态大语言模型的无监督自进化

Yunyao Yu, Zhengxian Wu, Zhuohong Chen, Hangrui Xu, Zirui Liao, Xiangwen Deng, Zhifang Liu, Senyuan Shi, Haoqian Wang

机构 * Tsinghua University(清华大学) Hefei University of Technology(合肥工业大学) University of Arizona(亚利桑那大学) MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所多模态人工智能系统实验室)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出CSRS方法,通过回溯推理机制和软化频率奖励提升多模态大语言模型的无监督自进化稳定性,实验显示在MathVision等基准上表现优异。

Comments 16 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09749 2026-04-07 cs.CE cs.AI 57%

Large Language Models for Combinatorial Optimization of Design Structure Matrix

大型语言模型用于设计结构矩阵的组合优化

Shuo Jiang, Min Xie, Jianxi Luo

机构 * City University of Hong Kong(香港城市大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出基于大型语言模型的框架,用于优化设计结构矩阵的序列,通过结合网络拓扑和领域知识提升收敛速度和解的质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23048 2026-04-06 cs.AI 57%

From Abstract to Contextual: What LLMs Still Cannot Do in Mathematics

从抽象到语境:大语言模型在数学中仍无法做到的事情

Bowen Cao, Dongdong Zhang, Yixia Li, Junpeng Liu, Shijue Huang, Chufan Shi, Hongyuan Lu, Yaokang Wu, Guanhua Chen, Wai Lam, Furu Wei

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 研究揭示LLM在现实应用中数学推理能力不足,提出ContextMATH基准测试,发现正确问题建模是成功的关键,但建模与推理仍是限制因素。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02236 2026-04-03 cs.AI 57%

Do Emotions in Prompts Matter? Effects of Emotional Framing on Large Language Models

提示中的情感重要吗?情感框架对大语言模型的影响

Minda Zhao, Yutong Yang, Chufei Peng, Rachel Gonsalves, Weiyue Li, Ruyi Yang, Zhixi Liu, Mengyu Wang

机构 * Harvard University(哈佛大学) Bryn Mawr College(布林莫尔学院)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 研究探讨了用户查询中第一人称情感框架对大语言模型在六个基准领域性能的影响,发现静态情感前缀通常仅产生小幅度变化,但社交相关任务中效果更不稳定,引入自适应情感提示框架EmotionRL后,适应性选择比固定情感提示更有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15929 2026-04-02 cs.AI math.AP math.LO 57%

Semi-Autonomous Formalization of the Vlasov-Maxwell-Landau Equilibrium

半自动化的Vlasov-Maxwell-Landau平衡形式化

Vasily Ilin

机构 * University of Washington(华盛顿大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 本文展示了一个完整的Lean 4形式化,用于Vlasov-Maxwell-Landau系统中的平衡特性描述,通过AI辅助数学研究流程,结合AI推理模型、编码工具和专业证明器,实现了高效的形式化验证。

Comments 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15613 2026-03-30 cs.CV cs.CL 57%

When to Think and When to Look: Uncertainty-Guided Lookback

何时思考,何时回顾:不确定性引导的回顾

Jing Bi, Filippos Bellos, Junjia Guo, Yayuan Li, Chao Huang, Yolo Y. Tang, Luchuan Song, Susan Liang, Zhongfei Mark Zhang, Jason J. Corso, Chenliang Xu

机构 * University of Rochester(罗切斯特大学) University of Michigan(密歇根大学) Binghamton University(宾汉姆顿大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 本文探讨了在大视觉语言模型中思考与回顾的平衡,提出不确定性引导的回顾策略,通过大规模对比实验提升MMMU性能,并在多个基准上取得新突破。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25633 2026-03-27 cs.AI 57%

Is Mathematical Problem-Solving Expertise in Large Language Models Associated with Assessment Performance?

大语言模型中的数学问题解决能力是否与评估表现相关?

Liang Zhang, Yu Fu, Xinyi Jin

机构 * University of Michigan(密歇根大学) The High School Affiliated to Minzu University of China(中央民族大学附属中学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 研究探讨了大语言模型在数学问题解决能力与评估表现之间的关系,发现模型在解决正确问题时评估准确率更高,但步级诊断仍需额外能力支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25284 2026-03-27 cs.AI 57%

SliderQuant: Accurate Post-Training Quantization for LLMs

SliderQuant: 针对LLMs的准确后训练量化

Shigeng Wang, Chao Li, Yangyuxuan Kang, Jiawei Fan, Zhonghong Ou, Anbang Yao

机构 * Intel Labs China(英特尔中国研究院) BUPT(北京邮电大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出SliderQuant框架,通过分层滑动量化方法优化不同层的量化敏感性,提升LLM在不同位宽下的精度。

Comments This work is accepted to ICLR 2026. Code is available at https://github.com/deep-optimization/SliderQuant

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24904 2026-03-27 cs.AI cs.CR 57%

On the Foundations of Trustworthy Artificial Intelligence

人工智能可信性的基础

TJ Dunham

机构 * ARC

专题命中 数学推理 :verifier(abstract);分类 cs.AI

AI总结 本文提出确定性推理是可信AI的必要充分条件,并通过信任熵量化非确定性的成本,证明验证失败概率精确为1-2^{-H_T}。通过构建纯整数推断引擎,验证了跨架构模型的确定性,展示了AI信任的本质是算术问题。

Comments 26 pages, 10 tables, 1 figure, 17 theorems/definitions/corollaries

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24375 2026-03-26 cs.CL 57%

Towards Reward Modeling for AI Tutors in Math Mistake Remediation

迈向数学错误纠正中的人工智能导师的奖励建模

Kseniia Petukhova, Ekaterina Kochmar

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出了一种基于人类偏好的人工智能导师奖励建模方法,通过合成数据和加权和数据提升模型准确性,达到0.74的配对准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23951 2026-03-26 cs.CL 57%

From AI Assistant to AI Scientist: Autonomous Discovery of LLM-RL Algorithms with LLM Agents

从AI助手到AI科学家:利用LLM代理自主发现LLM-RL算法

Sirui Xia, Yikai Zhang, Aili Chen, Siye Wu, Siyu Yuan, Yanghua Xiao

机构 * Shanghai Key Laboratory of Data Science, School of Computer Science, Fudan University(上海数据科学关键实验室,计算机科学学院,复旦大学) School of Data Science, Fudan University(数据科学学院,复旦大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出POISE框架,通过自动化发现语言模型的策略优化算法,改进了政策优化算法,提高了性能指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17074 2026-03-25 cs.LG 57%

PRISM: Demystifying Retention and Interaction in Mid-Training

PRISM:解开中期训练中保留与交互的谜团

Bharat Runwal, Ashish Agrawal, Anurag Roy, Rameswar Panda

机构 * IBM Research, MIT-IBM Watson AI Lab(IBM研究院,MIT-IBM沃森人工智能实验室)

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 PRISM通过七种基础模型的受控实验,发现中期训练能显著提升数学、代码和科学基准测试成绩,同时保持整体性能,且数据组成比强化学习更重要。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02050 2026-03-25 cs.AI cs.SE 57%

Rethinking the Role of Entropy in Optimizing Tool-Use Behaviors for Large Language Model Agents

重新思考熵在优化大语言模型代理工具使用行为中的作用

Zeping Li, Hongru Wang, Yiwen Zhao, Guanhua Chen, Yixia Li, Keyang Chen, Yixin Cao, Guangnan Ye, Hongfeng Chai, Zhenfei Yin

机构 * Fudan University(复旦大学) University of Edinburgh(爱丁堡大学) Southern University of Science and Technology(南方科技大学) Oxford University(牛津大学) Haven

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 本文通过熵基实验发现熵减与高质量工具调用正相关,提出两种奖励策略优化工具使用行为,实验表明熵减可提升代理适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22363 2026-03-25 cs.SE cs.AI 57%

Early Discoveries of Algorithmist I: Promise of Provable Algorithm Synthesis at Scale

算法主义I:大规模可证明算法合成的前景

Janardhan Kulkarni

机构 * Microsoft(微软)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出通过LLM生成可证明的算法,结合理论与实践,展示Algorithmist在隐私、近似和可解释性任务中的有效算法生成与验证。

Comments 75 pages, technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21574 2026-03-24 cs.AI 57%

Adaptive Robust Estimator for Multi-Agent Reinforcement Learning

自适应稳健估计器用于多智能体强化学习

Zhongyi Li, Wan Tian, Jingyu Chen, Kangyao Huang, Huiming Zhang, Hui Yang, Tao Ren, Jinyang Jiang, Yijie Peng, Yikun Ban, Fuzhen Zhuang

机构 * Beihang University(北京理工大学) Peking University(北京大学) Chinese Academy of Sciences(中国科学院) Tsinghua University(清华大学) Department of XXX, University of YYY, Location, Country(XXX系,YYY大学,地点,国家) School of ZZZ, Institute of WWW, Location, Country(ZZZ学院,WWW研究所,地点,国家)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出自适应稳健估计器和双智能体回答-批判-重写框架,解决多智能体协作中的信用分配和奖励噪声问题,提升训练稳定性与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12275 2026-03-24 cs.CL 57%

On-Policy Context Distillation for Language Models

在线策略上下文蒸馏用于语言模型

Tianzhu Ye, Li Dong, Xun Wu, Shaohan Huang, Furu Wei

机构 * Microsoft Research(微软研究院)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出在线策略上下文蒸馏框架,通过训练学生模型在生成轨迹的同时最小化逆Kullback-Leibler散度,提升模型在数学推理、文本游戏等任务中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20275 2026-03-24 cs.CV cs.AI 57%

Understanding Pruning Regimes in Vision-Language Models Through Domain-Aware Layer Selection

通过领域感知的层选择理解视觉-语言模型中的剪枝规则

Saeed Khaki, Nima Safaei, Kamal Ginotra

机构 * Microsoft AI(微软人工智能)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 研究通过领域感知激活相似性分析,揭示视觉-语言模型中不同剪枝预算下层移除对性能的影响,发现三种剪枝规则:低预算下性能敏感,中预算下结构损伤累积,高预算下结构连续性主导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16417 2026-03-18 cs.AI 57%

Via Negativa for AI Alignment: Why Negative Constraints Are Structurally Superior to Positive Preferences

通过否定来实现AI对齐:为什么否定约束在结构上优于积极偏好

Quan Cheng

机构 * Tsinghua University(清华大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 本文探讨了通过否定约束而非积极偏好进行AI对齐的结构优势,提出基于波普尔的证伪逻辑,指出否定信号方法在避免趋炎附势和提升效果上的有效性。

Comments 9 pages, position paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15723 2026-03-18 cs.AI 57%

Context-Length Robustness in Question Answering Models: A Comparative Empirical Study

问答模型中的上下文长度鲁棒性:一项比较实证研究

Trishita Dhara, Siddhesh Sheth

机构 * Upper Hand Ace Rent a Car

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 研究通过SQuAD和HotpotQA基准评估问答模型在上下文长度变化下的鲁棒性,发现多跳推理任务比单跨度提取任务更易受上下文稀释影响。

Comments Accepted for Oral Presentation at Math AI 2026 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15617 2026-03-17 cs.LG 57%

HorizonMath: Measuring AI Progress Toward Mathematical Discovery with Automatic Verification

HorizonMath:通过自动验证衡量AI向数学发现的进步

Erik Y. Wang, Sumeet Motwani, James V. Roggeveen, Eliot Hodges, Dulhan Jayalath, Charles London, Kalyan Ramakrishnan, Flaviu Cipcigan, Philip Torr, Alessandro Abate

机构 * University of Oxford(牛津大学) Benchmark Harvard University(哈佛大学) Princeton University(普林斯顿大学) Ellison Institute of Technology(Ellison技术研究所)

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 HorizonMath通过自动验证框架评估AI在数学发现中的进展,针对需要深入数学洞察但验证简单的难题,发现部分模型提出改进现有结果的解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15351 2026-03-17 cs.AI cs.MA 57%

PMAx: An Agentic Framework for AI-Driven Process Mining

PMAx:一种用于AI驱动流程挖掘的代理框架

Anton Antonov, Humam Kourani, Alessandro Berti, Gyunam Park, Wil M. P. van der Aalst

机构 * Fraunhofer Institute for Applied Information Technology(弗劳恩霍夫应用信息科技研究所) RWTH Aachen University(亚琛工业大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 PMAx通过隐私保护的多代理架构,使非技术人员能将业务问题转化为可靠流程洞察,避免LLM的确定性推理和隐私泄露问题。

Comments Submitted to EMMSAD 2026 (tool demonstration track), under review

详情

展开后加载摘要…

URL PDF HTML 收藏