arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-11-10 至 2025-11-10 共收录 4 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 4 篇

2506.05305 2025-11-10 cs.CL cs.AI cs.LG 81%

ProRefine: Inference-Time Prompt Refinement with Textual Feedback

Deepak Pandita, Tharindu Cyril Weerasooriya, Ankit Parag Shah, Isabelle Diana May-Xin Ng, Christopher M. Homan, Wei Wei

机构 * Center for Advanced AI, Accenture(高级人工智能研究中心,Accenture) Rochester Institute of Technology(罗切斯特理工学院) UC Berkeley(加州大学伯克利分校)

专题命中 测试时计算 :reasoning(abstract,comments);chain-of-thought(abstract);planning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Workshop on Efficient Reasoning at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04869 2025-11-10 cs.CL cs.LG stat.ML 73%

Trained on Tokens, Calibrated on Concepts: The Emergence of Semantic Calibration in LLMs

Preetum Nakkiran, Arwen Bradley, Adam Goliński, Eugene Ndiaye, Michael Kirchhof, Sinead Williamson

机构 * Apple(苹果公司)

专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05345 2025-11-10 cs.LG cs.CL 62%

Inference-Time Hyper-Scaling with KV Cache Compression

Adrian Łańcucki, Konrad Staniszewski, Piotr Nawrot, Edoardo M. Ponti

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.LG

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09338 2025-11-10 stat.ML cs.AI cs.LG 62%

Know What You Don't Know: Uncertainty Calibration of Process Reward Models

Young-Jin Park, Kristjan Greenewald, Kaveh Alim, Hao Wang, Navid Azizan

机构 * Massachusetts Institute of Technology(麻省理工学院) MIT-IBM Watson AI Lab(MIT-IBM沃森人工智能实验室) Red Hat AI Innovation(红帽人工智能创新)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

Comments Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏