arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-02-05 至 2026-02-05 共收录 7 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 7 篇

2602.04246 2026-02-05 cs.CL 85%

CoLT: Reasoning with Chain of Latent Tool Calls

CoLT:基于链式潜在工具调用的推理

Fangwei Zhu, Zhifang Sui

机构 * School of Computer Science, State Key Laboratory of Multimedia Information Processing, Peking University(计算机学院、多媒体信息处理国家重点实验室、北京大学)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

AI总结 CoLT通过将潜在推理转化为工具调用,实现高效推理,提升模型效率与准确性,适用于多种解码器结构和强化学习算法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04380 2026-02-05 cs.LG cs.AI 81%

Beyond KL Divergence: Policy Optimization with Flexible Bregman Divergences for LLM Reasoning

超越KL散度:基于灵活Bregman散度的群体策略优化用于大语言模型推理

Rui Yuan, Mykola Khandoga, Vinay Kumar Sankarapu

机构 * Lexsi Labs(Lexsi实验室)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出GBMPO框架,通过灵活Bregman散度提升大语言模型在数学推理和代码生成任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04391 2026-02-05 cs.CL 79%

Beyond Rejection Sampling: Trajectory Fusion for Scaling Mathematical Reasoning

超越拒绝采样:轨迹融合用于扩展数学推理

Jie Deng, Hanshuang Tong, Jun Li, Shining Liang, Ning Wu, Hongzhi Li, Yutao Xie

机构 * Microsoft(微软)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 TrajFusion通过融合错误与正确推理轨迹,改进数学推理微调,提升复杂问题表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04417 2026-02-05 cs.LG cs.AI 73%

EMA Policy Gradient: Taming Reinforcement Learning for LLMs with EMA Anchor and Top-k KL

EMA策略梯度:通过EMA锚点和Top-k KL驯服LLM的强化学习

Lunjun Zhang, Jimmy Ba

机构 * University of Toronto(多伦多大学)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.AI、cs.LG

AI总结 EMA-PG通过EMA锚点和Top-k KL估计器提升LLM强化学习性能,显著提高数学推理和代理任务表现

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.00843 2026-02-05 cs.AI cs.HC 57%

Benchmarking Large Language Models for Diagnosing Students' Cognitive Skills from Handwritten Math Work

对大型语言模型诊断学生手写数学作业认知技能的基准测试

Yoonsu Kim, Hyoungwook Jin, Hayeon Doh, Eunhye Kim, Dongyun Jung, Seungju Kim, Kiyoon Choi, Jinho Son, Juho Kim

机构 * School of Computing, KAIST, Daejeon, Republic of Korea(韩国庆熙大学计算机学院) University of Michigan, Ann Arbor, USA(美国密歇根大学) Ewha Womans University, Seoul, Republic of Korea(韩国成均馆大学) AlgorithmLabs, Seoul, Republic of Korea(韩国AlgorithmLabs公司)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 本文评估了18种大型语言模型在诊断学生手写数学作业认知技能时的表现,发现模型在模糊证据下表现不佳,揭示了模型在证据处理上的系统性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01075 2026-02-05 cs.AI 57%

ConvexBench: Can LLMs Recognize Convex Functions?

ConvexBench: LLMs能否识别凸函数?

Yepeng Liu, Yu Huang, Yu-Xiang Wang, Yingbin Liang, Yuheng Bu

机构 * UC Santa Barbara(加州大学圣芭芭拉分校) University of Pennsylvania(宾夕法尼亚大学) UC San Diego(加州大学圣地亚哥分校) The Ohio State University(俄亥俄州立大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 ConvexBench通过分治框架解决LLM在深度函数组合中识别凸性的挑战,显著提升大深度下的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02463 2026-02-05 cs.AI 57%

Extending RLVR to Open-Ended Tasks via Verifiable Multiple-Choice Reformulation

通过可验证的多选改写扩展RLVR以应对开放性任务

Mengyu Zhang, Siyu Ding, Weichong Yin, Yu Sun, Hua Wu

机构 * Baidu Ernie Team(百度文心团队)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出VMR-RLVR方法,通过将开放性任务数据转化为可验证的多选格式,提升LLM在无明确真实值情况下开放性任务的推理能力。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏