arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 2030 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 2030 篇

2602.13248 2026-02-17 cs.AI cs.CL cs.RO 73%

X-Blocks: Linguistic Building Blocks of Natural Language Explanations for Automated Vehicles

X-Blocks: 自然语言解释的语义构建块用于自动驾驶车辆

Ashkan Y. Zadeh, Xiaomeng Li, Andry Rakotonirainy, Ronald Schroeter, Sebastien Glaser, Zishuo Zhu

机构 * Queensland University of Technology (QUT)(昆士兰科技大学) ARC Training Centre for Automated Vehicles in Rural and Remote Regions (AVR3)(农村和偏远地区自动化车辆培训中心)

专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 X-Blocks框架通过分层分析识别自动驾驶车辆自然语言解释的构建块,提供场景感知解释的设计原则,提升透明性和用户信任。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08364 2025-12-02 cs.CL cs.AI 73%

DPRM: A Dual Implicit Process Reward Model in Multi-Hop Question Answering

DPRM: 多跳问答任务中的双隐式过程奖励模型

Xinyi Wang, Yiping Song, Zhiliang Tian, Bo Liu, Tingjin Luo, Minlie Huang

专题命中 测试时计算 :reasoning(abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 DPRM通过双隐式过程奖励模型提升多跳问答任务的推理准确性与一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08325 2025-11-12 cs.CL cs.IR cs.LG 73%

AgentPRM: Process Reward Models for LLM Agents via Step-Wise Promise and Progress

Zhiheng Xi, Chenyang Liao, Guanyu Li, Yajie Yang, Wenxiang Chen, Zhihao Zhang, Binghai Wang, Senjie Jin, Yuhao Zhou, Jian Guan, Wei Wu, Tao Ji, Tao Gui, Qi Zhang, Xuanjing Huang

机构 * Fudan University(复旦大学) Ant Group(蚂蚁集团)

专题命中 测试时计算 :reasoning(abstract);test-time compute(abstract);分类 cs.CL、cs.LG

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04869 2025-11-10 cs.CL cs.LG stat.ML 73%

Trained on Tokens, Calibrated on Concepts: The Emergence of Semantic Calibration in LLMs

Preetum Nakkiran, Arwen Bradley, Adam Goliński, Eugene Ndiaye, Michael Kirchhof, Sinead Williamson

机构 * Apple(苹果公司)

专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11730 2025-10-31 cs.AI cs.LG 73%

Rethinking Optimal Verification Granularity for Compute-Efficient Test-Time Scaling

Hao Mark Chen, Guanxi Lu, Yasuyuki Okoshi, Zhiwen Mo, Masato Motomura, Hongxiang Fan

机构 * Imperial College London, UK(伦敦帝国学院) Institute of Science Tokyo, Japan(东京科学研究所)

专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.AI、cs.LG

Comments Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02511 2025-10-23 cs.AI cs.CL 73%

Test-time Prompt Intervention

Chenxu Yang, Qingyi Si, Mz Dai, Dingyu Yao, Mingyu Zheng, Minghui Chen, Zheng Lin, Weiping Wang

专题命中 测试时计算 :reasoning(abstract);test-time compute(abstract);分类 cs.CL、cs.AI

Comments 24 pages, 20 figures, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.01735 2025-10-23 cs.CL cs.LG 73%

LASeR: Learning to Adaptively Select Reward Models with Multi-Armed Bandits

Duy Nguyen, Archiki Prasad, Elias Stengel-Eskin, Mohit Bansal

机构 * UNC Chapel Hill(杜克大学夏洛特分校) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 测试时计算 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.LG

Comments NeurIPS 2025 camera-ready. First two authors contributed equally. Code: https://github.com/duykhuongnguyen/LASeR-MAB

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08731 2025-10-13 cs.ET cs.AI cs.CL cs.SY eess.SY 73%

When to Reason: Semantic Router for vLLM

Chen Wang, Xunzhuo Liu, Yuhan Liu, Yue Zhu, Xiangxi Mo, Junchen Jiang, Huamin Chen

机构 * IBM Research(IBM研究院) Tencent(腾讯) University of Chicago(芝加哥大学) UC Berkeley(伯克利大学) Red Hat(红帽公司)

专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

Comments 5 pages, excluding references and appendix. To be appeared at Workshop on ML for Systems at NeurIPS 2025, December 6, 2025 https://mlforsystems.org/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02918 2025-09-22 cs.AI cs.LG 73%

World Modelling Improves Language Model Agents

Shangmin Guo, Omar Darwiche Domingues, Raphaël Avalos, Aaron Courville, Florian Strub

机构 * University of Edinburgh(爱丁堡大学) Cohere Vrije Universiteit Brussel(布鲁塞尔自由大学) Université de Montréal(蒙特利尔大学)

专题命中 测试时计算 :planning(abstract);test-time compute(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14279 2025-09-19 cs.SE cs.AI cs.LG 73%

Towards Robust Agentic CUDA Kernel Benchmarking, Verification, and Optimization

Robert Tjarko Lange, Qi Sun, Aaditya Prasad, Maxence Faldor, Yujin Tang, David Ha

专题命中 测试时计算 :test-time compute(abstract);verifier(abstract);分类 cs.AI、cs.LG

Comments 62 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.01245 2025-08-28 math.ST cs.CL cs.CR cs.LG stat.ML stat.TH 73%

A Statistical Framework of Watermarks for Large Language Models: Pivot, Detection Efficiency and Optimal Rules

Xiang Li, Feng Ruan, Huiyuan Wang, Qi Long, Weijie J. Su

机构 * University of Pennsylvania(宾夕法尼亚大学) Northwestern University(西北大学)

专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.CL、cs.LG

Comments Accepted by Annals of Statistics

Journal ref Ann. Statist. 53(1): 322-351 (February 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17797 2025-07-25 cs.LG cs.CL 73%

GenSelect: A Generative Approach to Best-of-N

Shubham Toshniwal, Ivan Sorokin, Aleksander Ficek, Ivan Moshkov, Igor Gitman

机构 * NVIDIA

专题命中 测试时计算 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.LG

Comments Presented at the 2nd AI for MATH Workshop @ ICML

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13569 2025-07-21 cs.LG cs.AI 73%

Change of Thought: Adaptive Test-Time Computation

Mrinal Mathur, Mike Doan, Barak Pearlmutter, Sergey Plis

机构 * Google Research(谷歌研究) TReNDS Center, Georgia State University(TReNDS中心,佐治亚州立大学) Maynooth University(迈诺特大学) Georgia State University/Georgia Institute of Technology/Emory University Center for Translational Research in Neuroimaging and Data Science (TReNDS Center)(佐治亚州立大学/佐治亚理工学院/埃默里大学神经影像与数据科学转化研究中心(TReNDS中心)) Department of Computer Science, Maynooth University(迈诺特大学计算机科学系)

专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19967 2025-06-26 cs.CL cs.AI 73%

Inference Scaled GraphRAG: Improving Multi Hop Question Answering on Knowledge Graphs

Travis Thompson, Seung-Hwan Lim, Paul Liu, Ruoying He, Dongkuan Xu

机构 * North Carolina State University(北卡罗来纳州立大学) Oak Ridge National Laboratory(奥本海默国家实验室)

专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17296 2025-06-24 cs.CL cs.AI 73%

Semantic uncertainty in advanced decoding methods for LLM generation

Darius Foodeei, Simin Fan, Martin Jaggi

机构 * EPFL, Lausanne Switzerland(日内瓦联邦理工学院)

专题命中 测试时计算 :chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05295 2025-06-13 cs.LG cs.AI stat.ML 73%

Sample Complexity and Representation Ability of Test-time Scaling Paradigms

Baihe Huang, Shanda Li, Tianhao Wu, Yiming Yang, Ameet Talwalkar, Kannan Ramchandran, Michael I. Jordan, Jiantao Jiao

机构 * University of California, Berkeley(加州大学伯克利分校) Carnegie Mellon University(卡内基梅隆大学)

专题命中 测试时计算 :verifier(abstract);self-correction(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20325 2025-05-28 cs.CL cs.AI 73%

Guided by Gut: Efficient Test-Time Scaling with Reinforced Intrinsic Confidence

Amirhosein Ghasemabadi, Keith G. Mills, Baochun Li, Di Niu

专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10559 2025-04-16 cs.LG cs.AI 73%

Efficient Process Reward Model Training via Active Learning

Keyu Duan, Zichen Liu, Xin Mao, Tianyu Pang, Changyu Chen, Qiguang Chen, Michael Qizhe Shieh, Longxu Dou

专题命中 测试时计算 :reasoning(abstract);math reasoning(abstract);分类 cs.AI、cs.LG

Comments 15 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.10581 2025-03-28 cs.LG cs.AI stat.ML 73%

Do We Need to Verify Step by Step? Rethinking Process Supervision from a Theoretical Perspective

Zeyu Jia, Alexander Rakhlin, Tengyang Xie

专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14382 2025-02-21 cs.LG cs.AI 73%

S*: Test Time Scaling for Code Generation

Dacheng Li, Shiyi Cao, Chengkun Cao, Xiuyu Li, Shangyin Tan, Kurt Keutzer, Jiarong Xing, Joseph E. Gonzalez, Ion Stoica

专题命中 测试时计算 :reasoning(abstract);test-time compute(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.00379 2025-02-18 cs.AI cs.CL 73%

GraphArena: Evaluating and Exploring Large Language Models on Graph Computation

Jianheng Tang, Qifan Zhang, Yuhan Li, Nuo Chen, Jia Li

专题命中 测试时计算 :chain-of-thought(abstract);test-time compute(abstract);分类 cs.CL、cs.AI

Comments ICLR 2025 camera ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.08048 2024-10-11 cs.LG cs.CL 73%

VerifierQ: Enhancing LLM Test Time Compute with Q-Learning-based Verifiers

Jianing Qi, Hao Tang, Zhigang Zhu

专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.21060 2024-08-01 cs.CL cs.AI 73%

Using Large Language Models for the Interpretation of Building Regulations

Stefan Fuchs, Michael Witbrock, Johannes Dimyadi, Robert Amor

专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

Comments Presented at the 13th Conference on Engineering, Project and Production Management

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.00204 2024-05-02 cs.CL cs.AI 73%

General Purpose Verification for Chain of Thought Prompting

Robert Vacareanu, Anurag Pratik, Evangelia Spiliopoulou, Zheng Qi, Giovanni Paolini, Neha Anna John, Jie Ma, Yassine Benajiba, Miguel Ballesteros

专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.CL、cs.AI

Comments 22 pages, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.04363 2024-03-15 cs.LG cs.CL 73%

Amortizing intractable inference in large language models

Edward J. Hu, Moksh Jain, Eric Elmoznino, Younesse Kaddar, Guillaume Lajoie, Yoshua Bengio, Nikolay Malkin

专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.LG

Comments ICLR 2024; 23 pages; code: https://github.com/GFNOrg/gfn-lm-tuning

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.09454 2023-10-17 cs.AI cs.LG 73%

LgTS: Dynamic Task Sampling using LLM-generated sub-goals for Reinforcement Learning Agents

Yash Shukla, Wenchang Gao, Vasanth Sarathy, Alvaro Velasquez, Robert Wright, Jivko Sinapov

专题命中 测试时计算 :reasoning(abstract);planning(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.17806 2023-07-03 cs.CL cs.CV cs.LG 73%

Stay on topic with Classifier-Free Guidance

Guillaume Sanchez, Honglu Fan, Alexander Spangher, Elad Levi, Pawan Sasanka Ammanamanchi, Stella Biderman

专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.14128 2023-05-24 cs.CL cs.AI 73%

Dr.ICL: Demonstration-Retrieved In-context Learning

Man Luo, Xin Xu, Zhuyun Dai, Panupong Pasupat, Mehran Kazemi, Chitta Baral, Vaiva Imbrasaite, Vincent Y Zhao

专题命中 测试时计算 :chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.05970 2023-04-13 cs.CL cs.LG 73%

Boosted Prompt Ensembles for Large Language Models

Silviu Pitis, Michael R. Zhang, Andrew Wang, Jimmy Ba

专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16253 2026-05-12 cs.CV cs.AI 72%

Grounding the Score: Explicit Visual Premise Verification for Reliable Vision-Language Process Reward Models

将评分接地:为可靠视觉语言处理奖励模型的显式视觉前提验证

Junxin Wang, Dai Guan, Weijie Qiu, Zhihang Li, Yongbo Gai, Zhengyi Yang, Mengyu Zhou, Erchao Zhao, Xiaoxi Jiang, Guanjun Jiang

机构 * Qwen Large Model Application Team, Alibaba(阿里巴巴大模型应用团队) Alibaba Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所阿里巴巴分所) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 测试时计算 :reasoning(abstract,comments);verifier(abstract);分类 cs.AI

AI总结 本文提出EVPV方法,通过显式验证视觉前提提升视觉语言处理奖励模型的可靠性,实验表明其在多模态推理基准上提升了重排序准确率。

Comments 27 pages, 4 figures, 10 tables. Evaluated on VisualProcessBench and six multimodal reasoning benchmarks (LogicVista, MMMU, MathVerse-VO, MathVision, MathVista, WeMath). Includes ablations and causal analysis via controlled constraint corruption. Code: https://github.com/Qwen-Applications/EVPV-PRM

详情

展开后加载摘要…

URL PDF HTML 收藏