arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 3227 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 3227 篇

2505.09655 2026-06-16 cs.CL cs.LG 版本更新 81%

DRA-GRPO: Your GRPO Needs to Know Diverse Reasoning Paths for Mathematical Reasoning

DRA-GRPO:你的GRPO需要了解多样化的推理路径以进行数学推理

Xiwen Chen, Wenhui Zhu, Peijie Qiu, Xuanzhao Dong, Hao Wang, Haiyu Wu, Huayu Li, Aristeidis Sotiras, Yalin Wang, Abolfazl Razi

机构 * Morgan Stanley(摩根士丹利) Clemson University(克莱姆森大学) Arizona State University(亚利桑那州立大学) Washington University in St. Louis(圣路易斯华盛顿大学) University of Notre Dame(圣母大学) University of Arizona(亚利桑那大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 针对GRPO在数学推理中因奖励信号非单射导致策略坍塌的问题,提出基于子模互信息的多样性感知奖励调整框架DRA,通过逆倾向评分去偏梯度估计,在五个数学基准上以少量数据和成本取得平均58.2%的准确率。

Comments ACL2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17104 2026-06-16 cs.AI cs.CL cs.LO 版本更新 81%

Towards Advanced Mathematical Reasoning for LLMs via First-Order Logic Theorem Proving

迈向基于一阶逻辑定理证明的大语言模型高级数学推理

Chuxue Cao, Mengze Li, Juntao Dai, Jinluan Yang, Zijian Zhao, Shengyu Zhang, Weijie Shi, Chengzhong Liu, Sirui Han, Yike Guo

机构 * Hong Kong University of Science and Technology(香港科学与技术大学) Peking University(北京大学) Zhejiang University(浙江大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 针对大语言模型在多步一阶逻辑数学推理中的困难,提出DREAM方法,通过公理驱动策略多样化和子命题错误反馈提升推理多样性和正确性,在定理证明数据集上性能提升0.6%-6.4%。

Comments Accepted by EMNLP 25

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03344 2026-06-10 cs.IR cs.AI cs.CL 版本更新 81%

RAG over Thinking Traces Can Improve Reasoning Tasks

RAG 基于思考轨迹可提升推理任务

Negar Arabzadeh, Wenjie Ma, Sewon Min, Matei Zaharia

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 提出检索思考轨迹而非文档,通过 T3 方法将其转化为结构化表示,在推理任务上显著提升性能,超越标准 RAG 和无 RAG 基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10254 2026-06-10 cs.AI cs.CL 新提交 81%

RealMath-Eval: Why SOTA Judges Struggle with Real Human Reasoning

RealMath-Eval:为何SOTA裁判难以应对真实人类推理

Yiteng Mao, Kenan Xu, Yijia Lyu, Wenhao Li, Jianlong Chen, Xiangfeng Wang

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) East China Normal University(华东师范大学) New York University(纽约大学) Tongji University(同济大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 提出RealMath-Eval基准,评估LLM裁判对真实学生数学解答的评分能力,发现与人类评分存在高均方误差,而合成数据上表现更好,揭示评估差距源于人类错误空间的多样性和高信息熵。

Comments Code available at https://github.com/RicharMd/RealMath-Eval , Data available at https://huggingface.co/datasets/RicharMd/RealMath-Eval

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09873 2026-06-10 cs.LG cs.AI 新提交 81%

Rotate2Think: Geometric Priming via Orthogonal Rotation to Improve Language Model Reasoning

Rotate2Think:通过正交旋转进行几何提示以提升语言模型推理能力

Aditya Sharma, Christopher J. Pal, Amal Zouaq

机构 * Polytechnique Montréal(蒙特利尔综合理工学院) Mila - Quebec AI Institute(Mila-魁北克人工智能研究所) LAMA-WeST Lab(LAMA-WeST实验室) Canada CIFAR AI Chair(加拿大CIFAR人工智能主席)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 发现推理模型的输入嵌入与思考嵌入存在高锥度且方向非共线,提出无训练方法Rotate2Think,通过正交Procrustes分析估计旋转并注入合成思考向量,在30/32配置中提升数学、科学和代码任务准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17196 2026-06-10 cs.LG cs.AI 81%

BudgetThinker: Empowering Budget-aware LLM Reasoning with Control Tokens

BudgetThinker: 通过控制令牌赋能预算感知的LLM推理

Hao Wen, Xinrui Wu, Yi Sun, Feifei Zhang, Liye Chen, Jie Wang, Yunxin Liu, Yunhao Liu, Ya-Qin Zhang, Yuanchun Li

机构 * Institute for AI Industry Research (AIR) Tsinghua University(人工智能产业研究院(AIR)清华大学) Global Innovation Exchange & Department of Automation Tsinghua University(全球创新交流中心及自动化系 清华大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 BudgetThinker通过在推理过程中插入控制令牌,使LLM能够精确控制推理过程长度,采用两阶段训练流程提升模型在不同预算下的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07006 2026-06-08 cs.LG cs.CL 新提交 81%

RASFT: Rollout-Adaptive Supervised Fine-Tuning for Reasoning

RASFT: 用于推理的滚动自适应监督微调

Yongliang Miao, Fengyuan Liu, Wei Shi, Yanguang Liu, Fei Sun, Na Zou, Mengnan Du

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) New Jersey Institute of Technology(新泽西理工学院) Institute of Computing Technology, CAS(中国科学院计算技术研究所)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 提出RASFT框架,通过基于策略rollout的问题级可解性校准专家监督,在模型困难时加强指导、表现可靠时放松模仿并纳入自生成轨迹,同时使用裁剪逆比约束策略漂移,在多个推理基准上优于SFT和RL方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06920 2026-06-08 cs.LG cs.AI 新提交 81%

The Fine-Tuning Trap: Evaluating Negative Transfer and the Role of PEFT in Sub-1B Mathematical Reasoning

微调陷阱:评估负迁移及PEFT在亚十亿参数数学推理中的作用

Rahul Nair, Chun Tao

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本研究评估了五种亚十亿参数模型在数学推理任务中的微调策略,发现全量微调对小于3亿参数的模型造成负迁移,而参数高效微调(PEFT)是稳定性要求。

Comments 8 pages, 6 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05704 2026-06-05 cs.AI cs.LG 81%

Critic-Guided Heterogeneous Multi-Agent Reasoning for Reliable Mathematical Problem Solving

基于评论的异构多智能体推理用于可靠的数学问题求解

Muhammad Talha Sharif, Abdul Rehman

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 提出一种基于评论的异构多智能体框架,通过生成器-验证器结构和自适应学习系统,利用中间反馈评估和引导推理过程,在GSM8K基准上实现高达13%的准确率提升,并减少对大模型的依赖。

Comments 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17310 2026-06-05 cs.AI cs.CL 81%

InfoDensity: Rewarding Information-Dense Traces for Efficient Reasoning

InfoDensity: 为高效推理奖励信息密集的轨迹

Chengwei Wei, Jung-jae Kim, Longyin Zhang, Shengkai Chen, Nancy F. Chen

机构 * Institute for Infocomm Research (I 2 R), A*STAR, Singapore(信息与通信研究机构(I 2 R),A*STAR,新加坡) Centre for Frontier AI Research (CFAR), A*STAR, Singapore(前沿人工智能研究中心(CFAR),A*STAR,新加坡)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出InfoDensity框架,通过捕捉推理轨迹的信息密度特性,改进强化学习训练中的推理质量与效率平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07408 2026-06-04 cs.CL cs.LG 81%

Outcome-Grounded Advantage Reshaping for Fine-Grained Credit Assignment in Mathematical Reasoning

基于结果锚定的优势重塑用于数学推理中的细粒度信用分配

Ziheng Li, Liu Kang, Feng Xiao, Luxi Xing, Qingyi Si, Zhuoran Li, Weikang Gong, Deqing Yang, Yanghua Xiao, Hongcheng Guo

机构 * Fudan University(复旦大学) XingYun lab, HUJING Digital Media & Entertainment Group(星云实验室,HUJING数字媒体与娱乐集团) University of Science and Technology Beijing(北京科技大学) Chinese Academy of Sciences(中国科学院) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 提出结果锚定优势重塑(OAR),通过两种策略(OAR-P和OAR-G)实现细粒度信用分配,显著提升GRPO在数学推理中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06165 2026-06-03 cs.CL cs.AI 81%

UR$^2$: Unify RAG and Reasoning through Reinforcement Learning

UR$^2$:通过强化学习统一检索增强生成与推理

Weitao Li, Boran Xiang, Xiaolong Wang, Zhinan Gou, Weizhi Ma, Yang Liu

机构 * Dept. of Comp. Sci. & Tech., Institute for AI, Tsinghua University, Beijing, China(计算机科学与技术系,人工智能研究院,清华大学,北京,中国) Institute for AI Industry Research (AIR), Tsinghua University, Beijing, China(人工智能产业研究机构(AIR),清华大学,北京,中国) School of Management Science & Information Engineering, Hebei University of Economics and Business, Hebei, China(管理科学与信息工程学院,河北经贸大学,河北,中国)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 提出UR$^2$框架,通过强化学习动态协调检索与推理,结合难度感知课程和混合知识访问策略,在开放域问答、MMLU-Pro、医学和数学推理任务上优于现有基线,性能接近GPT-4o-mini和GPT-4.1-mini。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00674 2026-06-02 cs.LG cs.AI 81%

The Paradox of Outcome Optimization: A Causal Information-Theoretic Bound on Reasoning Shortcuts in LLMs

结果优化的悖论:LLM中推理捷径的因果信息论界限

Zihan Chen, Yiming Zhang, Wenxiang Geng, Zenghui Ding, Yining Sun

机构 * HFIPS, Chinese Academy of Sciences(中国科学院HFIPS) University of Science and Technology of China(中国科学技术大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 针对基于结果强化学习的LLM在分布外任务中推理脆弱的问题,提出因果信息论框架解释奖励诱导的流形坍缩,并证明过程奖励模型作为拓扑滤波器可消除低复杂度捷径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12400 2026-06-02 cs.LG cs.AI 81%

OGLS-SD: On-Policy Self-Distillation with Outcome-Guided Logit Steering for LLM Reasoning

OGLS-SD:基于结果引导的对数几率操控的在线自蒸馏用于大语言模型推理

Yuxiao Yang, Xiaoyun Wang, Weitong Zhang

机构 * UNC Chapel Hill(UNC夏洛特山分校)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 提出OGLS-SD框架,通过结果奖励校准教师对数几率,解决在线自蒸馏中师生响应模式不匹配导致的训练不稳定问题,提升数学推理性能。

Comments 17 pages, 10 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03259 2026-06-02 cs.LG cs.AI 81%

Verifying Meta-Awareness via Predictive Rewards in Reasoning Models

通过推理模型中的预测奖励验证元意识

Yoonjeon Kim, Doohyuk Jang, Eunho Yang

机构 * Yoonjeon Kim, Doohyuk Jang, Eunho Yang

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 提出 MAPR 方法,利用自生成任务预测推理统计量(长度、通过率、概念)来增强模型的元意识,从而在多个数学推理基准上显著提升准确率和训练效率。

Comments accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29126 2026-05-29 cs.LG cs.AI 81%

When and How Long? The Readout-Mediator Angle in Temporal Reasoning

何时与多久?时间推理中的读出-中介角度

Shreyas Fadnavis, Praitayini Kanakaraj, Felix Wyss

机构 * Bioscope AI

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 通过测量线性探针与模型实际计算子空间之间的角度,发现探针可能学习与模型无关的正交方向,从而揭示基于探针的可解释性存在根本缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26733 2026-05-27 cs.LG cs.AI 81%

Stabilizing Recurrent Dynamics for Test-Time Scalable Latent Reasoning in Looped Language Models

循环语言模型中测试时可扩展潜在推理的稳定循环动力学

Xiao-Wen Yang, Ziyu Han, Xi-Hua Zhang, Wen-Da Wei, Jie-Jing Shao, Lan-Zhe Guo, Yu-Feng Li

机构 * State Key Laboratory of Novel Software Technology, Nanjing University, Nanjing, China(新型软件技术国家重点实验室,南京大学,南京,中国) School of Artificial Intelligence, Nanjing University, Nanjing, China(人工智能学院,南京大学,南京,中国) School of Intelligence Science and Technology, Nanjing University, Nanjing, China(智能科学与技术学院,南京大学,南京,中国)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 提出STARS训练框架,通过雅可比谱半径正则化约束潜在状态趋近渐近稳定不动点,解决循环语言模型深度递归时性能崩溃问题,实现可靠的测试时扩展并提升峰值性能。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02979 2026-05-26 cs.CL cs.LG 81%

CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning

CPMobius: 无数据强化学习的迭代式教练-玩家推理

Ran Li, Zeyuan Liu, Yinghao Chen, Bingxiang He, Jiarui Yuan, Zixuan Fu, Weize Chen, Jinyi Hu, Chen Qian, Zhiyuan Liu, Maosong Sun

机构 * Tsinghua University(清华大学) University of Cambridge(剑桥大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 提出CPMobius协作式教练-玩家范式,通过无外部数据的合作优化循环提升数学推理能力,在Qwen2.5-Math-7B-Instruct上总体准确率提升4.9%,OOD准确率提升5.4%。

Comments Accepted to the ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24613 2026-05-26 cs.CL cs.AI cs.SE 81%

Guarded Repair for Harm-Aware Post-hoc Replacement of LLM Mathematical Reasoning

Guarded Repair: 面向危害感知的LLM数学推理事后替换

Haizhou Xia

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 提出GuardedRepair框架,通过选择性替换机制在修复LLM数学推理错误时避免破坏正确结果,在GSM8K上准确率从95.60%提升至96.89%且未破坏正确案例。

Comments 15 pages,including appendices. Code and artifacts available at https://github.com/Haizhoux0517/guarded-repair

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16778 2026-05-26 cs.LG cs.AI 81%

Federation over Text: Insight Sharing for Multi-Agent Reasoning

文本上的联邦:多智能体推理的洞察共享

Dixi Yao, Tahseen Rabbani, Manzil Zaheer, Tian Li

机构 * University of Chicago(芝加哥大学) Google DeepMind(谷歌DeepMind)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 提出一种类似联邦学习的框架FoT,通过迭代聚合多个客户端的本地推理过程,构建跨任务元认知洞察库,无需共享问题实例或任务指令,显著提升推理效果和效率。

Comments 46 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13323 2026-05-26 cs.AI cs.LG 81%

Error-Driven Prompt Optimization for Arithmetic Reasoning

基于错误驱动的算术推理提示优化

Árpád Pándy, Róbert Lakatos, András Hajdu

机构 * Deptartment of Data Science & Visualization, Faculty of Informatics, University of Debrecen(数据科学与可视化系,信息学院,德布勒恩大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 提出一种错误驱动的提示优化框架,通过聚类错误预测迭代优化提示规则,使小型本地语言模型在算术推理任务中准确率达到70.8%,超越GPT-3.5 Turbo。

Journal ref IEEE Access, vol. 14, pp. 62570-62583, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23926 2026-05-26 cs.AI cs.LG 81%

How Much Thinking is Enough? Quantifying and Understanding Redundancy in LLM Reasoning

多少思考才足够?量化和理解LLM推理中的冗余

Zhiyuan Zhai, Xinkai You, Wenjing Yan, Xin Wang

机构 * Fudan University(复旦大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文通过形式化推理冗余度量,量化了前沿推理模型在数学基准上高达61%-93%的步骤级冗余,并证明这种冗余是长度无关结果奖励的结构性后果,而非模型特定伪影。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23200 2026-05-25 cs.LG cs.AI 81%

Adaptive Mass-Segmented KV Compression for Long-Context Reasoning

自适应质量分段KV压缩用于长上下文推理

Junzhe Yang, Xiaoyu Shen

机构 * Shanghai Jiao Tong University(上海交通大学) Institute of Digital Twin, Eastern Institute of Technology(数字孪生研究院,东部技术研究所)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 提出自适应质量分段(AMS)KV压缩框架,通过区域感知配额分配替代全局Top-k选择,防止推理块被过度驱逐,从而保持逻辑连贯性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09349 2026-05-25 cs.CV cs.AI cs.CL 81%

Visually-Guided Policy Optimization for Multimodal Reasoning

视觉引导的多模态推理策略优化

Zengbin Wang, Feng Xiong, Liang Lin, Xuecai Hu, Yong Wang, Yanlin Wang, Man Zhang, Xiangxiang Chu

机构 * AMAP, Alibaba Group(阿里集团AMAP) SYSU(南方科技大学) BUPT(北京邮电大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 针对视觉语言模型在推理中视觉关注不足和时序遗忘问题,提出视觉引导策略优化(VGPO)框架,通过视觉注意力补偿机制和双粒度优势重加权策略增强视觉聚焦,提升多模态推理性能。

Comments Accepted to ACL 2026, https://github.com/wzb-bupt/VGPO

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14652 2026-05-25 cs.AI cs.CL cs.MA 81%

MAS-Orchestra: Understanding and Improving Multi-Agent Reasoning Through Holistic Orchestration and Controlled Benchmarks

MAS-Orchestra:通过整体编排和受控基准理解与改进多智能体推理

Zixuan Ke, Yifei Ming, Austin Xu, Ryan Chin, Xuan-Phi Nguyen, Prathyusha Jwalapuram, Jiayu Wang, Semih Yavuz, Caiming Xiong, Shafiq Joty

机构 * Salesforce Research(Salesforce研究院) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Massachusetts Institute of Technology(麻省理工学院)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 提出MAS-Orchestra框架,将多智能体系统编排形式化为函数调用的强化学习问题,并引入受控基准MASBENCH,揭示MAS收益依赖于任务结构等因素,在数学推理等任务上取得一致改进且效率提升10倍以上。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22263 2026-05-22 cs.LG cs.AI 81%

Tailoring Teaching to Aptitude: Direction-Adaptive Self-Distillation for LLM Reasoning

按能力定制教学:方向自适应自蒸馏用于LLM推理

Hongbin Zhang, Chaozheng Wang, Kehai Chen, Youcheng Pan, Yang Xiang, Jinpeng Wang, Min Zhang

机构 * Institute of Computing and Intelligence, Harbin Institute of Technology(计算智能研究所,哈尔滨工业大学) Peng Cheng Laboratory(鹏城实验室) Keeta AI, Meituan(Keeta AI,美团)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出方向自适应自蒸馏(DASD),通过熵引导的定向监督改进LLM推理,通过分析发现统一的教师监督导致探索被压制,DASD在六个数学推理基准中取得最佳表现。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07962 2026-05-22 cs.CL cs.AI 81%

LightReasoner: Can Small Language Models Teach Large Language Models Reasoning?

LightReasoner: 小型语言模型能否教会大型语言模型推理?

Jingyuan Wang, Yankai Chen, Zhonghang Li, Chao Huang

机构 * University of Hong Kong(香港大学) University of Chicago(芝加哥大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出LightReasoner框架,通过利用强专家模型与弱业余模型之间的行为差异,发现高价值推理时刻,从而提升大型语言模型的推理能力,同时减少资源消耗。

Comments Updated to ACL 2026 camera-ready version with improved method presentation, expanded related work discussion, additional analyses, and presentation refinements

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19762 2026-05-20 cs.AI cs.CL 81%

What Really Improves Mathematical Reasoning: Structured Reasoning Signals Beyond Pure Code

什么真正提升了数学推理:超越纯代码的结构化推理信号

Yuze Zhao, Junpeng Fang, Lu Yu, Zhenya Huang, Kai Zhang, Qing Cui, Qi Liu, Jun Zhou, Enhong Chen

机构 * State Key Laboratory of Cognitive Intelligence, University of Science(认知智能国家重点实验室,科学大学) Institute of Artificial Intelligence, Hefei Comprehensive National Science Centerce(人工智能研究院,合肥综合性国家科学中心) Individual Researcher(个人研究员) Zhejiang University, Hangzhou, China(浙江大学,杭州,中国)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文通过控制预训练实验研究代码对推理能力的影响,发现代码主要提升编程能力而非通用推理,且在复杂数学推理中与知识密集型任务竞争,同时结构化推理轨迹(如代码-文本和数学-文本混合)比纯可执行代码更能提升推理能力。

Comments Accepted by ICML 2026, 22 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15851 2026-05-19 cs.LG cs.AI cs.CR 81%

DPrivBench: Benchmarking LLMs' Reasoning for Differential Privacy

DPrivBench:评估大语言模型在差分隐私推理中的基准测试

Erchi Wang, Pengrun Huang, Eli Chien, Om Thakkar, Kamalika Chaudhuri, Yu-Xiang Wang, Ruihan Wu

机构 * Halıcıoğlu Data Science Institute, UC San Diego(哈里奇奥格卢数据科学研究所,加州大学圣地亚哥分校) Department of Computer Science and Engineering, UC San Diego(计算机科学与工程系,加州大学圣地亚哥分校) Department of Electrical Engineering, National Taiwan University(电气工程系,国立台湾大学) OpenAI

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出DPrivBench基准测试,用于评估大语言模型在差分隐私推理中的能力,发现当前模型在高级算法推理上存在显著差距,并为改进自动化差分隐私推理提供了方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10528 2026-05-19 cs.CL cs.LG 81%

Merlin's Whisper: Enabling Efficient Reasoning in Large Language Models via Black-box Persuasive Prompting

Merlin's Whisper:通过黑盒说服提示增强大语言模型的高效推理

Heming Xia, Cunxiao Du, Rui Li, Chak Tou Leong, Yongqi Li, Wenjie Li

机构 * Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算机系) Sea AI Lab(Sea AI实验室) Peking University(北京大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出Whisper框架,通过黑盒说服提示减少大语言模型(LRM)的推理过程中的token使用量,同时保持性能,展示了在多个基准测试中显著的token减少效果。

Comments ACL 2026 (Long Paper), camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏