arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 45335 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 3246 篇

2510.24592 2026-02-11 cs.CL 57%

ReForm: Reflective Autoformalization with Prospective Bounded Sequence Optimization

ReForm:具有前瞻性有界序列优化的反思自动形式化

Guoxin Chen, Jing Wu, Xinjie Chen, Wayne Xin Zhao, Ruihua Song, Chengxi Li, Kai Fan, Dayiheng Liu, Minpeng Liao

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院) Tongyi Lab, Alibaba Group(阿里巴巴集团通义实验室) Zhejiang University(浙江大学) Beijing Key Laboratory of Research on Large Models and Intelligent Governance(北京大模型与智能治理重点实验室)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 ReForm通过整合语义一致性评估和前瞻性有界序列优化,提升自动形式化任务的准确性和语义保真度,实验表明其在四个基准上的性能提升了22.6个百分点。

Comments Camera Ready version for ICLR 2026. Code: https://github.com/Chen-GX/ReForm

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04787 2026-02-10 cs.MA cs.AI 57%

Trade in Minutes! Rationality-Driven Agentic System for Quantitative Financial Trading

一分钟内交易!基于理性驱动的量化金融交易代理系统

Zifan Song, Kaitao Song, Guosheng Hu, Ding Qi, Junyao Gao, Xiaohua Wang, Dongsheng Li, Cairong Zhao

机构 * Tongji University(同济大学) Microsoft Research Asia(微软亚洲研究院) University of Bristol(布里斯托大学) Fudan University(复旦大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 TiMi是一种基于理性驱动的多代理系统,通过解耦策略开发与分钟级部署,实现量化金融交易的高效稳定盈利。

Comments 17 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04620 2026-02-09 cs.LG 57%

QUATRO: Query-Adaptive Trust Region Policy Optimization for LLM Fine-tuning

QUATRO:用于LLM微调的查询自适应信任区域策略优化

Doyeon Lee, Eunyi Lyou, Hyunsoo Cho, Sookyung Kim, Joonseok Lee, Jaemoo Choi

机构 * Seoul National University(首尔国立大学) Ewha Woman University(成均馆大学) Geogia Institute of Technology(佐治亚理工学院)

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 QUATRO通过原则性优化直接施加信任区域约束,实现稳定且可控的LLM微调,提升训练稳定性与熵控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06291 2026-02-09 cs.CL 57%

Judging What We Cannot Solve: A Consequence-Based Approach for Oracle-Free Evaluation of Research-Level Math

判断我们无法解决的内容:一种基于后果的方法用于无Oracle评估研究级数学

Guijin Son, Donghun Yang, Hitesh Laxmichand Patel, Hyunwoo Ko, Amit Agarwal, Sunghee Ahn, Kyong-Ha Lee, Youngjae Yu

机构 * snu(首尔国立大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出基于后果的无Oracle评估方法,用于评估研究级数学问题的求解质量,通过测试候选方案在相关问题中的表现,有效提升评估准确性。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05261 2026-02-06 cs.CL 57%

Length-Unbiased Sequence Policy Optimization: Revealing and Controlling Response Length Variation in RLVR

长度无偏序列策略优化:揭示和控制RLVR中的响应长度变化

Fanfan Liu, Youyang Yin, Peng Shi, Siqi Yang, Zhixiong Zeng, Haibo Qiu

机构 * Meituan(美团)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出LUSPO算法,通过消除长度偏差解决RLVR中响应长度崩溃问题,并在多个任务中展示出优于现有方法的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.00843 2026-02-05 cs.AI cs.HC 57%

Benchmarking Large Language Models for Diagnosing Students' Cognitive Skills from Handwritten Math Work

对大型语言模型诊断学生手写数学作业认知技能的基准测试

Yoonsu Kim, Hyoungwook Jin, Hayeon Doh, Eunhye Kim, Dongyun Jung, Seungju Kim, Kiyoon Choi, Jinho Son, Juho Kim

机构 * School of Computing, KAIST, Daejeon, Republic of Korea(韩国庆熙大学计算机学院) University of Michigan, Ann Arbor, USA(美国密歇根大学) Ewha Womans University, Seoul, Republic of Korea(韩国成均馆大学) AlgorithmLabs, Seoul, Republic of Korea(韩国AlgorithmLabs公司)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 本文评估了18种大型语言模型在诊断学生手写数学作业认知技能时的表现,发现模型在模糊证据下表现不佳,揭示了模型在证据处理上的系统性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01075 2026-02-05 cs.AI 57%

ConvexBench: Can LLMs Recognize Convex Functions?

ConvexBench: LLMs能否识别凸函数?

Yepeng Liu, Yu Huang, Yu-Xiang Wang, Yingbin Liang, Yuheng Bu

机构 * UC Santa Barbara(加州大学圣芭芭拉分校) University of Pennsylvania(宾夕法尼亚大学) UC San Diego(加州大学圣地亚哥分校) The Ohio State University(俄亥俄州立大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 ConvexBench通过分治框架解决LLM在深度函数组合中识别凸性的挑战,显著提升大深度下的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02463 2026-02-05 cs.AI 57%

Extending RLVR to Open-Ended Tasks via Verifiable Multiple-Choice Reformulation

通过可验证的多选改写扩展RLVR以应对开放性任务

Mengyu Zhang, Siyu Ding, Weichong Yin, Yu Sun, Hua Wu

机构 * Baidu Ernie Team(百度文心团队)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出VMR-RLVR方法,通过将开放性任务数据转化为可验证的多选格式,提升LLM在无明确真实值情况下开放性任务的推理能力。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03075 2026-02-04 cs.CL 57%

ReMiT: RL-Guided Mid-Training for Iterative LLM Evolution

ReMiT: 通过强化学习指导的迭代大语言模型进化

Junjie Huang, Jiarui Qin, Di Yin, Weiwen Liu, Yong Yu, Xing Sun, Weinan Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Tencent Youtu Lab(腾讯优图实验室)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 ReMiT通过强化学习指导中训练过程,实现大语言模型的迭代进化,提升模型在数学、代码和推理任务上的表现。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03073 2026-02-04 cs.LG 57%

TMS: Trajectory-Mixed Supervision for Reward-Free, On-Policy SFT

TMS:轨迹混合监督用于无奖励、在线策略微调

Rana Muhammad Shahroz Khan, Zijie Liu, Zhen Tan, Charles Fleming, Tianlong Chen

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 TMS通过轨迹混合监督在无奖励的情况下提升大语言模型的保留能力,有效弥补了传统SFT与RL之间的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26313 2026-02-03 cs.CL 57%

One-Token Rollout: Guiding Supervised Fine-Tuning of LLMs with Policy Gradient

单个标记回滚:通过策略梯度引导大语言模型的监督微调

Rui Ming, Haoyuan Wu, Shoubo Hu, Zhuolun He, Bei Yu

机构 * The Chinese University of Hong Kong(香港中文大学) Noah’s Ark Lab, Huawei(华为诺亚实验室) ChatEDA Tech(ChatEDA技术公司)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 通过策略梯度引导监督微调,单个标记回滚(OTR)在多个基准测试中优于标准SFT,展示了on-policy数据对泛化能力的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23135 2026-02-02 cs.LG 57%

Why GRPO Needs Normalization: A Local-Curvature Perspective on Adaptive Gradients

为何GRPO需要规范化:从局部曲率角度探讨自适应梯度

Cheng Ge, Caitlyn Heqi Yin, Hao Liang, Jiawei Zhang

机构 * Department of Aeronautics and Astronautics, MIT(麻省理工学院航空与宇航系) Department of Statistics, University of Wisconsin--Madison(威斯康星大学麦迪逊分校统计系) Department of Informatics, King's College London(伦敦国王学院信息学系) Department of Computer Sciences, University of Wisconsin--Madison(威斯康星大学麦迪逊分校计算机科学系)

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 GRPO中标准差规范化通过局部曲率视角解释了其自适应梯度机制,理论和实验表明规范化能提升收敛速度并优化训练阶段表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23006 2026-02-02 cs.CL 57%

InstructDiff: Domain-Adaptive Data Selection via Differential Entropy for Efficient LLM Fine-Tuning

InstructDiff:通过微分熵实现领域自适应的数据选择以实现高效的LLM微调

Junyou Su, He Zhu, Xiao Luo, Liyu Zhang, Hong-Yu Zhou, Yun Chen, Peng Li, Yang Liu, Guanhua Chen

机构 * Peking University(北京大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Tsinghua University(清华大学) SUFE(上海财经大学) SUSTech(南方科技大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 InstructDiff通过微分熵实现领域自适应的数据选择,提升LLM微调效率,实验显示在数学推理和通用指令遵循任务上分别提高17%和52%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19439 2026-02-02 cs.CL 57%

Surrogate Signals from Format and Length: Reinforcement Learning for Solving Mathematical Problems without Ground Truth Answers

从格式和长度获取代理信号:用于无真实答案解决数学问题的强化学习

Rihui Xin, Han Liu, Zecheng Wang, Yupeng Zhang, Dianbo Sui, Xiaolin Hu, Bingning Wang

机构 * Baichuan Inc(百川公司) Tsinghua University(清华大学) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 本研究提出利用格式和长度作为代理信号,通过强化学习提升数学问题解决性能,无需真实答案,实现高效推理优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15172 2026-02-02 cs.AI 57%

Self-Improvement of Language Models by Post-Training on Multi-Agent Debate

通过多智能体辩论进行语言模型的自改进

Ankur Samanta, Akshayaa Magesh, Runzhe Wu, Ayush Jain, Youliang Yu, Daniel Jiang, Boris Vidolov, Paul Sajda, Yonathan Efroni, Kaveh Hassani

机构 * Meta AI Columbia University(哥伦比亚大学) Meta Superintelligence Labs(Meta超智能实验室)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 通过多智能体辩论和强化学习提升语言模型的自我改进能力,实现推理准确性、自洽性和泛化能力的提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22132 2026-01-30 cs.LG 57%

Pay for Hints, Not Answers: LLM Shepherding for Cost-Efficient Inference

为提示付费,而非答案:用于高效推断的LLM牧师

Ziming Dong, Hardik Sharma, Evan O'Toole, Jaya Prakash Champati, Kui Wu

机构 * Department of Computer Science, University of Victoria, Victoria, Canada(维多利亚大学计算机科学系) Department Of Information Technology, Manipal University, Manipal, India(马那尔大学信息科技系)

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 LLM牧师通过请求LLM的短提示来提高SLM的准确性,显著降低推断成本,同时保持准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09785 2026-01-29 cs.AI 57%

AI Annotation Orchestration: Evaluating LLM verifiers to Improve the Quality of LLM Annotations in Learning Analytics

AI标注协调:评估LLM验证器以提高学习分析中LLM标注的质量

Bakhtawar Ahtisham, Kirk Vanacore, Jinsook Lee, Zhuqian Zhou, Doug Pietrzak, Rene F. Kizilcec

专题命中 数学推理 :verifier(abstract);分类 cs.AI

AI总结 本文通过评估LLM验证器提升学习分析中标注质量,提出灵活的协调框架和实证比较方法,展示验证在提高标注可靠性中的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18533 2026-01-27 cs.CL 57%

From Verifiable Dot to Reward Chain: Harnessing Verifiable Reference-based Rewards for Reinforcement Learning of Open-ended Generation

从可验证点到奖励链:利用基于可验证参考的奖励进行开放生成的强化学习

Yuxin Jiang, Yufei Wang, Qiyuan Zhang, Xingshan Zeng, Liangyou Li, Jierun Chen, Chaofan Tao, Haoli Bai, Lifeng Shang

机构 * Huawei Technologies Co.,Ltd(华为技术有限公司) City University of Hong Kong(香港城市大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出基于可验证参考的强化学习方法,通过提取奖励链提升开放生成任务的效率和可靠性。

Comments 19 pages, 8 figures, 12 tables. Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13379 2026-01-27 cs.AI cs.CV 57%

The Art of Saying "Maybe": A Conformal Lens for Uncertainty Benchmarking in VLMs

也许的艺术:一种用于VLMs不确定性基准测试的共形透镜

Asif Azad, Mohammad Sadat Hossain, MD Sadik Hossain Shanto, M Saifur Rahman, Md Rizwan Parvez

机构 * Bangladesh University of Engineering and Technology(孟加拉工程与技术大学) Qatar Computing Research Institute(卡塔尔计算研究所)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出了一种用于VLMs不确定性基准测试的共形透镜,评估了18种最先进的VLMs在6个多元数据集上的表现,发现更大模型在不确定性量化方面表现更佳,而数学和推理任务则表现出较差的不确定性性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01078 2026-01-26 cs.AI 57%

SimWorld: An Open-ended Realistic Simulator for Autonomous Agents in Physical and Social Worlds

SimWorld:一种用于物理和社会世界中自主代理的开放式真实模拟器

Jiawei Ren, Yan Zhuang, Xiaokang Ye, Lingjun Mao, Xuhong He, Jianzhi Shen, Mrinaal Dogra, Yiming Liang, Ruixuan Zhang, Tianai Yue, Yiqing Yang, Eric Liu, Ryan Wu, Kevin Benavente, Rajiv Mandya Nagaraju, Muhammad Faayez, Xiyan Zhang, Dhruv Vivek Sharma, Xianrui Zhong, Ziqiao Ma, Tianmin Shu, Zhiting Hu, Lianhui Qin

机构 * UCSD(加州大学圣地亚哥分校) UVA(弗吉尼亚大学) UIUC(伊利诺伊大学香槟分校) JHU(约翰·霍普金斯大学) Purdue(Purdue 大学) PolyU USC(美国南加州大学) UMich(密歇根大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 SimWorld是一个基于Unreal Engine 5构建的开放式真实模拟器,旨在开发和评估LLM/VLM代理在复杂物理和社会环境中的能力,通过多代理配送任务验证其推理模式与局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04700 2026-01-21 cs.CL 57%

PRISM: A Unified Framework for Post-Training LLMs Without Verifiable Rewards

PRISM: 一种无需可验证奖励的统一后训练LLM框架

Mukesh Ghimire, Aosong Feng, Liwen You, Youzhi Luo, Fang Liu, Xuan Zhu

机构 * Arizona State University(亚利桑那州立大学) Amazon Web Services(亚马逊网络服务)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 PRISM通过结合过程奖励模型与自我确定性,实现无需真实标签的稳定训练和提升LLM测试性能。

Comments Added open-sourced github url

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11485 2026-01-19 cs.CL 57%

Mistake Notebook Learning: Batch-Clustered Failures for Training-Free Agent Adaptation

错误笔记本学习:用于无训练代理适应的批量聚类失败

Xuanbo Su, Yingfang Zhang, Hao Luo, Xiaoteng Liu, Leo Huang

机构 * Bairong Inc.(柏龙公司) School of Mathematics, Harbin Institute of Technology(哈尔滨工业大学数学学院) School of Software, Jilin University(吉林大学软件学院)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 MNL通过批量聚类失败提炼结构化错误笔记,提升代理适应性和鲁棒性,无需参数更新。

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.15437 2026-01-19 cs.AI cs.HC math.HO 57%

Apriori Knowledge in an Era of Computational Opacity: The Role of AI in Mathematical Discovery

在计算不透明时代中的先验知识:人工智能在数学发现中的作用

Eamon Duede, Kevin Davey

机构 * Purdue University(普渡大学) Argonne National Laboratory(阿贡国家实验室) University of Chicago(芝加哥大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 本文探讨了在计算不透明时代,通过AI获取数学先验知识的挑战与可能方法,强调证明检查器在其中的关键作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22979 2026-01-15 cs.LG 57%

OptiMind: Teaching LLMs to Think Like Optimization Experts

OptiMind: 教授大语言模型像优化专家一样思考

Xinzhi Zhang, Zeyi Chen, Humishka Zope, Hugo Barbalho, Konstantina Mellou, Marco Molinaro, Janardhan Kulkarni, Ishai Menache, Sirui Li

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 OptiMind通过整合优化专业知识,提升大语言模型在混合整数线性规划中的公式准确性,实现20.7%的提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21005 2026-01-14 cs.AI cs.IR 57%

ICPO: Intrinsic Confidence-Driven Group Relative Preference Optimization for Efficient Reinforcement Learning

ICPO:内在置信度驱动的群体相对偏好优化用于高效强化学习

Jinpeng Wang, Chao Li, Ting Ye, Mengyuan Zhang, Wei Liu, Jian Luan

机构 * MiLM Plus, Xiaomi Inc.(小米公司)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 ICPO通过内在置信度驱动的群体相对偏好优化,提升大型语言模型的推理能力,有效解决粗粒度奖励和奖励噪声问题,增强高质量响应的相对优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07264 2026-01-13 cs.CL 57%

The Confidence Dichotomy: Analyzing and Mitigating Miscalibration in Tool-Use Agents

置信二元性:分析和缓解工具使用代理中的校准偏差

Weihao Xuan, Qingcheng Zeng, Heli Qi, Yunze Xiao, Junjue Wang, Naoto Yokoya

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 本研究提出强化学习框架,通过优化任务准确性和校准,缓解工具使用代理中的校准偏差,提升其在不同领域和环境中的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05607 2026-01-12 cs.LG 57%

Orchestrating Tokens and Sequences: Dynamic Hybrid Policy Optimization for RLVR

协调标记与序列:动态混合策略优化用于RLVR

Zijun Min, Bingshuai Liu, Ante Wang, Long Zhang, Anxiang Zeng, Haibo Zhang, Jinsong Su

机构 * School of Informatics, Xiamen University(厦门大学信息学院) LLM Team, Shopee Pte. Ltd.(Shopee 股份有限公司语言模型团队) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院)

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出动态混合策略优化方法,通过结合标记级和序列级重要性比率,提升RLVR在数学推理任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05298 2026-01-12 cs.AI 57%

Mathematical Knowledge Graph-Driven Framework for Equation-Based Predictive and Reliable Additive Manufacturing

基于数学知识图谱的方程驱动框架用于基于方程的预测和可靠的增材制造

Yeongbin Cha, Namjung Kim

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 本研究提出基于数学知识图谱的框架,结合大语言模型与增材制造知识图谱,实现可靠的知识提取和外推建模,提升预测的准确性和物理一致性。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04675 2026-01-09 cs.AI 57%

LLM-Guided Quantified SMT Solving over Uninterpreted Functions

基于大语言模型的量化SMT求解与不可解释函数

Kunhang Lv, Yuhang Dong, Rui Han, Fuqi Jia, Feifei Ma, Jian Zhang

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 AquaForte利用大语言模型提供语义指导,通过生成满足约束条件的函数定义实例化候选,显著减少SMT求解的搜索空间和复杂性,有效解决传统求解器超时的实例。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03723 2026-01-08 cs.LG 57%

ETR: Outcome-Guided Elastic Trust Regions for Policy Optimization

ETR: 以结果为导向的弹性信任区域用于策略优化

Shijie Zhang, Kevin Zhang, Zheyuan Gu, Xiang Guo, Rujun Guo, Shaoyu Liu, Guanjun Jiang, Xiaozhao Wang

机构 * Alibaba Group(阿里巴巴集团) Peking University(北京大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 ETR通过动态信任区域机制,提升策略优化的信号利用效率和探索稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏