arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-11-10 至 2025-11-10 共收录 5 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 5 篇

2505.13438 2025-11-10 cs.LG cs.AI cs.CL 85%

Optimizing Anytime Reasoning via Budget Relative Policy Optimization

Penghui Qi, Zichen Liu, Tianyu Pang, Chao Du, Wee Sun Lee, Min Lin

机构 * Sea AI Lab(Sea AI实验室) National University of Singapore(新加坡国立大学)

专题命中 数学推理 :reasoning(title,abstract);test-time compute(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04800 2025-11-10 cs.CL 79%

Explore Data Left Behind in Reinforcement Learning for Reasoning Language Models

Chenxi Liu, Junjie Liang, Yuqi Jia, Bochuan Cao, Yang Bai, Heng Huang, Xun Chen

机构 * University of Maryland, College Park(马里兰大学学院市分校) ByteDance(字节跳动) Duke University(杜克大学) Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17803 2025-11-10 cs.CL 79%

DRQA: Dynamic Reasoning Quota Allocation for Controlling Overthinking in Reasoning Large Language Models

Kaiwen Yan, Xuanqing Shi, Hongcheng Guo, Wenxuan Wang, Zhuosheng Zhang, Chengwei Qin

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) The Hong Kong University of Science and Technology(香港科学与技术大学) Tsinghua University(清华大学) Fudan University(复旦大学) Renmin University of China(中国人民大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03222 2025-11-10 cs.LG cs.CL 62%

Low-probability Tokens Sustain Exploration in Reinforcement Learning with Verifiable Reward

Guanhua Huang, Tingqiang Xu, Mingze Wang, Qi Yi, Xue Gong, Siheng Li, Ruibin Xiong, Kejiao Li, Yuhao Jiang, Bo Zhou

机构 * LLM Department, Tencent(腾讯大模型部门) Tsinghua University(清华大学) Peking University(北京大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03703 2025-11-10 cs.LG cond-mat.dis-nn cond-mat.stat-mech cond-mat.str-el physics.comp-ph 57%

Learning-at-Criticality in Large Language Models for Quantum Field Theory and Beyond

Xiansheng Cai, Sihan Hu, Tao Wang, Yuan Huang, Pan Zhang, Youjin Deng, Kun Chen

机构 * Institute of Theoretical Physics, Chinese Academy of Sciences, Beijing 100190, China(理论物理研究所,中国科学院,北京) Hefei National Laboratory, University of Science and Technology of China, Hefei 230088, China(合肥国家实验室,中国科学技术大学,合肥) Department of Physics, University of Massachusetts, Amherst, MA 01003, USA(物理系,马萨诸塞大学,阿姆赫斯特) Institute of Physics, Chinese Academy of Sciences, Beijing 100190, China(物理研究所,中国科学院,北京) School of Fundamental Physics and Mathematical Sciences, Hangzhou Institute for Advanced Study, UCAS, Hangzhou 310024, China(基础物理与数学科学学院,杭州高等研究院,UCAS,杭州) Hefei National Laboratory, Hefei 230088, China(合肥国家实验室,合肥) Hefei National Laboratory for Physical Sciences at the Microscale(微尺度物理科学国家实验室,合肥) Department of Modern Physics, University of Science and Technology of China, Hefei 230026, China(现代物理系,中国科学技术大学,合肥)

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏