arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-10-21 至 2025-10-21 共收录 7 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 7 篇

2504.01005 2025-10-21 cs.CL cs.AI cs.LG 87%

When To Solve, When To Verify: Compute-Optimal Problem Solving and Generative Verification for LLM Reasoning

Nishad Singhi, Hritik Bansal, Arian Hosseini, Aditya Grover, Kai-Wei Chang, Marcus Rohrbach, Anna Rohrbach

机构 * TU Darmstadt(图恩-达姆施塔特技术大学) UCLA(加州大学洛杉矶分校) Google Deepmind(谷歌DeepMind) Mila(蒙特利尔人工智能研究院)

专题命中 测试时计算 :reasoning(title,abstract);test-time compute(abstract);verifier(abstract);分类 cs.CL、cs.AI、cs.LG

Comments COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16449 2025-10-21 cs.CL 83%

TrajSelector: Harnessing Latent Representations for Efficient and Effective Best-of-N in Large Reasoning Model

Bin Yu, Xinming Wang, Shijie Lian, Haotian Li, Changti Wu, Ruina Hu, Bailing Wang, Yuliang Wei, Kai Chen

机构 * Harbin Institute of Technology(哈尔滨工业大学) Zhongguancun Academy(中关村学院) Zhongguancun Institute of Artificial Intelligence(中关村人工智能研究院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Huazhong University of Science and Technology(华中科技大学) East China Normal University(东华大学)

专题命中 测试时计算 :reasoning(title,abstract);verifier(abstract);分类 cs.CL

Comments 13 pages, 6 figures. Project website: https://zgca-ai4edu.github.io/TrajSelector

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02298 2025-10-21 cs.LG cs.AI cs.CL 82%

CAPO: Towards Enhancing LLM Reasoning through Generative Credit Assignment

Guofu Xie, Yunsheng Shi, Hongtao Tian, Ting Yao, Xiao Zhang

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(人工智能学院,中国人民大学) Tencent Inc(腾讯公司)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12535 2025-10-21 cs.CL cs.AI cs.LG 67%

CorrSteer: Generation-Time LLM Steering via Correlated Sparse Autoencoder Features

Seonglae Cho, Zekun Wu, Adriano Koshiyama

机构 * University College London(伦敦大学学院)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 42 pages, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17028 2025-10-21 cs.CL cs.LG 62%

Mapping from Meaning: Addressing the Miscalibration of Prompt-Sensitive Language Models

Kyle Cox, Jiawei Xu, Yikun Han, Rong Xu, Tianhao Li, Chi-Yang Hsu, Tianlong Chen, Walter Gerych, Ying Ding

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.LG

Journal ref Proceedings of the AAAI Conference on Artificial Intelligence. 39, 22 (Apr. 2025), 23696-23703

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15707 2025-10-21 cs.LG cs.AI 62%

Every Rollout Counts: Optimal Resource Allocation for Efficient Test-Time Scaling

Xinglin Wang, Yiwei Li, Shaoxiong Feng, Peiwen Yuan, Yueqi Zhang, Jiayi Shi, Chuyi Tan, Boyuan Pan, Yao Hu, Kan Li

机构 * School of Computer Science, Beijing Institute of Technology(计算机学院,北京理工大学) Xiaohongshu Inc(小红书公司)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

Comments Accepted at NeurIPS2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17771 2025-10-21 cs.AI cs.CV 57%

Seeing but Not Believing: Probing the Disconnect Between Visual Attention and Answer Correctness in VLMs

Zhining Liu, Ziyi Chen, Hui Liu, Chen Luo, Xianfeng Tang, Suhang Wang, Joy Zeng, Zhenwei Dai, Zhan Shi, Tianxin Wei, Benoit Dumoulin, Hanghang Tong

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Amazon(亚马逊) Penn State University(宾夕法尼亚州立大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

Comments 21 pages, 10 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏