arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-12-02 至 2025-12-02 共收录 11 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 11 篇

2510.06108 2025-12-02 cs.LG cs.CL 88%

Influence Functions for Efficient Data Selection in Reasoning

用于推理中高效数据选择的影响函数

Prateek Humane, Paolo Cudrano, Daniel Z. Kaplan, Matteo Matteucci, Supriyo Chakraborty, Irina Rish

机构 * Mila, Québec AI Institute(魁北克AI研究院) Université de Montréal(蒙特利尔大学) Politecnico di Milano(米兰理工学院) Sage Group(Sage集团) Capital One

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);math reasoning(abstract)

AI总结 本文提出通过影响函数定义推理数据质量,并引入基于影响的修剪方法,以提升数学推理性能。

Comments 4 pages, 2 figures; added link to codebase

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.11373 2025-12-02 cs.CL cs.AI 81%

Reliable Reasoning Beyond Natural Language

超越自然语言的可靠推理

Nasim Borazjanizadeh, Steven T. Piantadosi

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出神经符号推理方法,通过整合Prolog引擎,解决LLMs在非线性推理任务中的不足,提升推理能力和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00908 2025-12-02 cs.LG cs.AI 81%

Beyond High-Entropy Exploration: Correctness-Aware Low-Entropy Segment-Based Advantage Shaping for Reasoning LLMs

超越高熵探索:面向推理LLM的正确性感知低熵段优势塑造

Xinzhu Chen, Xuesheng Li, Zhongxiang Sun, Weijie Yu

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) School of Artificial Intelligence and Data Science, University of International Business and Economics(国际经济贸易大学人工智能与数据科学学院) Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学北京校区人工智能学院)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 LESS通过正确性感知的低熵段优势调节,提升推理LLM的准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18449 2025-12-02 cs.SE cs.AI cs.CL 81%

SWE-RL: Advancing LLM Reasoning via Reinforcement Learning on Open Software Evolution

SWE-RL:通过强化学习提升大语言模型推理能力

Yuxiang Wei, Olivier Duchenne, Jade Copet, Quentin Carbonneaux, Lingming Zhang, Daniel Fried, Gabriel Synnaeve, Rishabh Singh, Sida I. Wang

机构 * Meta AI University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Carnegie Mellon University(卡内基梅隆大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 SWE-RL通过强化学习提升大语言模型在软件工程领域的推理能力,实现了41.0%的解决率,超越了现有中等规模LLM的性能。

Comments Accepted to NeurIPS 2025 Main Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00552 2025-12-02 cs.CL 79%

Catch Me If You Can: How Smaller Reasoning Models Pretend to Reason with Mathematical Fidelity

捉摸不到:为何小型推理模型用数学严谨性伪装推理

Subramanyam Sahoo, Vinija Jain, Saanidhya Vats, Siddharth Mohapatra, Rui Min, Aman Chadha, Divya Chaudhary

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 该研究提出诊断框架,揭示小型模型依赖模式匹配而非真实逻辑计算,通过四个轴线评估推理忠实性,推动可验证的数学推理研究。

Comments 8 pages, 5 figures. A preprint. Initial Work

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27044 2025-12-02 cs.LG 79%

Limits of Generalization in RLVR: Two Case Studies in Mathematical Reasoning

RLVR在数学推理中的泛化极限:两个案例研究

Md Tanvirul Alam, Nidhi Rastogi

机构 * Rochester Institute of Technology(罗切斯特理工学院)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.LG

AI总结 RLVR在数学推理任务中通过强化表面启发式方法提升指标,但难以获得真实推理策略,凸显其泛化能力的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00466 2025-12-02 cs.CL cs.AI 73%

SCALE: Selective Resource Allocation for Overcoming Performance Bottlenecks in Mathematical Test-time Scaling

SCALE:面向数学测试时间扩展中性能瓶颈的有选择性资源分配

Yang Xiao, Chunpu Xu, Ruifeng Yuan, Jiashuo Wang, Wenjie Li, Pengfei Liu

专题命中 数学推理 :reasoning(abstract);test-time compute(abstract);分类 cs.CL、cs.AI

AI总结 SCALE通过有选择性地分配计算资源,提升数学推理性能,显著优于均匀扩展方法。

Comments accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20347 2025-12-02 cs.LG cs.AI cs.CL 67%

Soft Adaptive Policy Optimization

软适应策略优化

Chang Gao, Chujie Zheng, Xiong-Hui Chen, Kai Dang, Shixuan Liu, Bowen Yu, An Yang, Shuai Bai, Jingren Zhou, Junyang Lin

机构 * Qwen Team, Alibaba Inc(阿里巴巴公司)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SAPO通过软门替代硬剪裁,提升大语言模型强化学习的稳定性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01420 2025-12-02 cs.CL cs.AI 62%

PromptBridge: Cross-Model Prompt Transfer for Large Language Models

PromptBridge: 跨模型提示迁移用于大型语言模型

Yaxuan Wang, Quan Liu, Zhenting Wang, Zichao Li, Wei Wei, Yang Liu, Yujia Bao

机构 * University of California, Santa Cruz(加州大学圣克ruz分校) Center for Advanced AI, Accenture(Accenture高级人工智能研究中心)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 PromptBridge通过跨模型提示迁移技术,解决模型切换时提示效果下降的问题,提升下游任务准确性并减少迁移成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18649 2025-12-02 cs.CL 57%

Evaluating Large Language Models on the 2026 Korean CSAT Mathematics Exam: Measuring Mathematical Ability in a Zero-Data-Leakage Setting

评估大型语言模型在2026年韩国CSAT数学考试中的表现:在零数据泄漏环境下测量数学能力

Goun Pyeon, Inbum Heo, Jeesu Jung, Taewook Hwang, Hyuk Namgoong, Hyein Seo, Yerim Han, Eunbin Kim, Hyeonseok Kang, Sangkeun Jung

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 本研究评估了24种LLM在2026年韩国CSAT数学考试中的表现,发现文本输入优于图像输入,GPT-5系列模型在特定配置下达到满分,同时揭示了微积分领域表现最差,且高难度问题对模型性能影响显著。

Comments 52 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00344 2025-12-02 cs.AI 57%

Echo-N1: Affective RL Frontier

Echo-N1:情感强化学习前沿

Naifan Zhang, Ruihan Sun, Ruixi Su, Shiqi Ma, Shiya Zhang, Xianna Weng, Xiaofan Zhang, Yuhan Zhan, Yuyang Xu, Zhaohan Chen, Zhengyuan Pan, Ziyi Song

机构 * Echo-N1: Affective RL Frontier Team(情感强化学习前沿团队)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 Echo-N1通过实时推断用户个性并优化个性化对话偏好,开创了情感强化学习的新领域,显著提升了人类般的交互质量。

详情

展开后加载摘要…

URL PDF HTML 收藏