arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-09-22 至 2025-09-22 共收录 2 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 2 篇

2506.02918 2025-09-22 cs.AI cs.LG 73%

World Modelling Improves Language Model Agents

Shangmin Guo, Omar Darwiche Domingues, Raphaël Avalos, Aaron Courville, Florian Strub

机构 * University of Edinburgh(爱丁堡大学) Cohere Vrije Universiteit Brussel(布鲁塞尔自由大学) Université de Montréal(蒙特利尔大学)

专题命中 测试时计算 :planning(abstract);test-time compute(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.11006 2025-09-22 cs.LG cs.CL 62%

Entropy-Regularized Process Reward Model

Hanning Zhang, Pengcheng Wang, Shizhe Diao, Yong Lin, Rui Pan, Hanze Dong, Dylan Zhang, Pavlo Molchanov, Tong Zhang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Toronto(多伦多大学) NVIDIA(英伟达) Princeton University(普林斯顿大学) Salesforce Research(Salesforce研究)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.LG

Comments Upate TMLR version

详情

展开后加载摘要…

URL PDF HTML 收藏