arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-02-27 至 2026-02-27 共收录 4 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 4 篇

2602.22583 2026-02-27 cs.AI cs.CL 81%

Strategy Executability in Mathematical Reasoning: Leveraging Human-Model Differences for Effective Guidance

数学推理中的策略可执行性:利用人类-模型差异实现有效指导

Weida Liang, Yiyou Sun, Shuyuan Nan, Chuang Li, Dawn Song, Kenji Kawaguchi

机构 * National University of Singapore(新加坡国立大学) University of California, Berkeley(加州大学伯克利分校)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出SSR框架,通过显式建模策略可执行性,利用人类-模型差异提升数学推理的指导效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21189 2026-02-27 cs.LG cs.AI 73%

Why Pass@k Optimization Can Degrade Pass@1: Prompt Interference in LLM Post-training

为何Pass@k优化会损害Pass@1:LLM微调中的提示干扰

Anas Barakat, Souradip Chakraborty, Khushbu Pahwa, Amrit Singh Bedi

机构 * Singapore University of Technology and Design(新加坡科技设计大学) University of Maryland, College Park(马里兰大学学院公园分校) University of Central Florida(佛罗里达中央大学)

专题命中 数学推理 :reasoning(abstract);verifier(abstract);分类 cs.AI、cs.LG

AI总结 该研究揭示了在LLM微调中,pass@k优化可能损害pass@1的原因,通过梯度冲突和提示干扰机制,提出了理论解释并验证了实验结果。

Comments updated related work discussion

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22296 2026-02-27 cs.LG cs.AI 62%

UpSkill: Mutual Information Skill Learning for Structured Response Diversity in LLMs

UpSkill: 为大语言模型的结构化响应多样性进行互信息技能学习

Devan Shah, Owen Yang, Daniel Yang, Chongyi Zheng, Benjamin Eysenbach

机构 * Princeton University(普林斯顿大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 UpSkill通过互信息技能学习提升大语言模型在结构化响应多样性中的表现,提高pass@k准确性而不影响pass@1。

Comments First two authors equal contribution. 29 pages total (11 pages main text), 10 figures, 10 tables. Project website: https://dshah.io/upskill/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21306 2026-02-27 cs.CL 57%

PARL: Prompt-based Agents for Reinforcement Learning

PARL:基于提示的强化学习智能体

Yarik Menchaca Resendiz, Roman Klinger

机构 * Fundamentals of Natural Language Processing, University of Bamberg, Germany(自然语言处理基础,巴姆伯格大学,德国)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 PARL是一种基于提示的强化学习智能体,利用预训练语言模型在无需微调的情况下完成RL任务,适用于简单环境但受限于复杂数学运算任务。

详情

展开后加载摘要…

URL PDF HTML 收藏