arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 2030 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 2030 篇

2504.00762 2025-11-11 cs.AI 79%

Do We Truly Need So Many Samples? Multi-LLM Repeated Sampling Efficiently Scales Test-Time Compute

Jianhao Chen, Zishuo Xun, Bocheng Zhou, Han Qi, Hangfan Zhang, Qiaosheng Zhang, Yang Chen, Wei Hu, Yuzhong Qu, Wanli Ouyang, Shuyue Hu

机构 * State Key Laboratory for Novel Software Technology(新型软件技术国家重点实验室) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) The University of Auckland(奥克兰大学) The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 测试时计算 :test-time compute(title,abstract);分类 cs.AI

Journal ref AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18751 2025-11-07 cs.AI cs.CV 79%

Seg the HAB: Language-Guided Geospatial Algae Bloom Reasoning and Segmentation

Patterson Hsieh, Jerry Yeh, Mao-Chi He, Wen-Han Hsieh, Elvis Hsieh

机构 * UC San Diego(加州大学圣地亚哥分校) UC Berkeley(加州大学伯克利分校)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.24198 2025-11-05 cs.CL 79%

TwT: Thinking without Tokens by Habitual Reasoning Distillation with Multi-Teachers' Guidance

Jingxian Xu, Mengyu Zhou, Weichang Liu, Hanbing Liu, Shi Han, Dongmei Zhang

机构 * Nankai University(南开大学) BeijingJiaoTong University(北京交通大学) Tsinghua University(清华大学) Microsoft Research(微软研究院)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21473 2025-10-27 cs.CL 79%

MRO: Enhancing Reasoning in Diffusion Language Models via Multi-Reward Optimization

Chenglong Wang, Yang Gan, Hang Zhou, Chi Hu, Yongyu Mu, Kai Song, Murun Yang, Bei Li, Chunliang Zhang, Tongran Liu, Jingbo Zhu, Zhengtao Yu, Tong Xiao

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17472 2025-10-24 stat.ML cs.LG 79%

Certified Self-Consistency: Statistical Guarantees and Test-Time Training for Reliable Reasoning in LLMs

Paula Cordero-Encinar, Andrew B. Duncan

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15440 2025-10-20 cs.CV cs.AI 79%

Select Less, Reason More: Prioritizing Evidence Purity for Video Reasoning

Xuchen Li, Xuzhao Li, Shiyu Hu, Kaiqi Huang

机构 * CASIA(中国科学院自动化研究所) UCAS(中国科学院自动化研究所) ZGCA(中钢集团自动化研究所) NTU(国立台湾大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI

Comments Preprint, Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12167 2025-10-20 cs.CL 79%

Towards Inference-time Scaling for Continuous Space Reasoning

Minghan Wang, Thuy-Trang Vu, Ehsan Shareghi, Gholamreza Haffari

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL

Comments Submitted to AAAI 2026 on July 25, 2025. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14942 2025-10-17 cs.AI 79%

GroundedPRM: Tree-Guided and Fidelity-Aware Process Reward Modeling for Step-Level Reasoning

Yao Zhang, Yu Wu, Haowei Zhang, Weiguo Li, Haokun Chen, Jingpei Wu, Guohao Li, Zhen Han, Volker Tresp

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10494 2025-10-14 cs.AI 79%

Tracing the Traces: Latent Temporal Signals for Efficient and Accurate Reasoning

Martina G. Vilas, Safoora Yousefi, Besmira Nushi, Eric Horvitz, Vidhisha Balachandran

机构 * Goethe University Frankfurt(法兰克福歌德大学) Microsoft Research(微软研究院) NVIDIA(英伟达)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07642 2025-10-10 cs.CL 79%

Role-Conditioned Refusals: Evaluating Access Control Reasoning in Large Language Models

Đorđe Klisura, Joseph Khoury, Ashish Kundu, Ram Krishnan, Anthony Rios

机构 * University of Texas at San Antonio(德克萨斯大学圣安东尼奥分校) Louisiana State University(路易斯安那州立大学) Cisco Research(思科研究)

专题命中 测试时计算 :reasoning(title);verifier(abstract);分类 cs.CL

Comments 8 pages + Appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01032 2025-10-02 cs.LG 79%

Meaningless Tokens, Meaningful Gains: How Activation Shifts Enhance LLM Reasoning

Zeru Shi, Yingjia Wan, Zhenting Wang, Qifan Wang, Fan Yang, Elisa Kreiss, Ruixiang Tang

机构 * Rutgers University(罗格斯大学) UCLA(加州大学洛杉矶分校) Meta AI Wake Forest University(威克森林大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23285 2025-10-01 cs.AI 79%

Toward Effective Tool-Integrated Reasoning via Self-Evolved Preference Learning

Yifei Chen, Guanting Dong, Zhicheng Dou

机构 * Renmin University of China(中国人民大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23621 2025-09-29 cs.CL 79%

Table-R1: Inference-Time Scaling for Table Reasoning

Zheyuan Yang, Lyuhao Chen, Arman Cohan, Yilun Zhao

机构 * Yale NLP Lab(耶鲁大学自然语言处理实验室) Carnegie Mellon University(卡内基梅隆大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL

Comments EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12663 2025-09-29 cs.CL 79%

Demystifying Multilingual Chain-of-Thought in Process Reward Modeling

Weixuan Wang, Minghao Wu, Barry Haddow, Alexandra Birch

机构 * School of Informatics, University of Edinburgh(爱丁堡大学信息学院) Monash University(墨尔本大学)

专题命中 测试时计算 :chain-of-thought(title);reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11474 2025-09-23 cs.CL 79%

Med-PRM: Medical Reasoning Models with Stepwise, Guideline-verified Process Rewards

Jaehoon Yun, Jiwoong Sohn, Jungwoo Park, Hyunjae Kim, Xiangru Tang, Yanjun Shao, Yonghoe Koo, Minhyeok Ko, Qingyu Chen, Mark Gerstein, Michael Moor, Jaewoo Kang

机构 * Korea University(韩国大学) ETH Zürich(苏黎世联邦理工学院) Yale University(耶鲁大学) AIGEN Sciences(AIGEN公司) Hanyang University College of Medicine(翰雅大学医学院) University of Ulsan College of Medicine(釜山大学医学院)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL

Comments Accepted to EMNLP 2025 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15512 2025-09-10 cs.CL 79%

Step-level Verifier-guided Hybrid Test-Time Scaling for Large Language Models

Kaiyan Chang, Yonghao Shi, Chenglong Wang, Hang Zhou, Chi Hu, Xiaoqian Liu, Yingfeng Luo, Yuan Ge, Tong Xiao, Jingbo Zhu

机构 * School of Computer Science and Engineering, Northeastern University(东北大学计算机科学与工程学院) NiuTrans Research(NiuTrans研究院) ByteDance(字节跳动)

专题命中 测试时计算 :verifier(title);reasoning(abstract);分类 cs.CL

Comments Accepted by EMNLP 2025. Code: https://github.com/Lucky-259/Hybrid_TTS

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02401 2025-09-03 cs.AI 79%

Towards Agents That Know When They Don't Know: Uncertainty as a Control Signal for Structured Reasoning

Josefa Lia Stoisser, Marc Boubnovski Martell, Lawrence Phillips, Gianluca Mazzoni, Lea Mørch Harder, Philip Torr, Jesper Ferkinghoff-Borg, Kaspar Martens, Julien Fauqueur

机构 * Novo Nordisk(诺和制药) University of Oxford(牛津大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00258 2025-08-26 cs.AI 79%

Hidden in Plain Sight: Reasoning in Underspecified and Misspecified Scenarios for Multimodal LLMs

Qianqi Yan, Hongquan Li, Shan Jiang, Yang Zhao, Xinze Guan, Ching-Chen Kuo, Xin Eric Wang

机构 * University of California, Santa Cruz(加州大学圣克鲁兹分校) eBay

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15202 2025-08-22 cs.CL 79%

Fin-PRM: A Domain-Specialized Process Reward Model for Financial Reasoning in Large Language Models

Yuanchen Zhou, Shuo Jiang, Jie Zhu, Junhui Li, Lifan Guo, Feng Chen, Chi Zhang

机构 * School of Computer Science and Technology, Soochow University(苏州大学计算机科学与技术学院) Qwen DianJin Team, Alibaba Cloud Computing(阿里云量子金融团队)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09968 2025-08-14 cs.LG cs.CV 79%

Noise Hypernetworks: Amortizing Test-Time Compute in Diffusion Models

Luca Eyring, Shyamgopal Karthik, Alexey Dosovitskiy, Nataniel Ruiz, Zeynep Akata

机构 * Technical University of Munich(慕尼黑技术大学) Munich Center of Machine Learning(慕尼黑机器学习中心) Helmholtz Munich(海德堡-慕尼黑 Helmholtz 中心) University of Tübingen(图宾根大学) Inceptive(Inceptive 公司) Google(谷歌公司)

专题命中 测试时计算 :test-time compute(title);reasoning(abstract);分类 cs.LG

Comments Project page: https://noisehypernetworks.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23170 2025-08-05 cs.LG 79%

BAR Conjecture: the Feasibility of Inference Budget-Constrained LLM Services with Authenticity and Reasoning

Jinan Zhou, Rajat Ghosh, Vaishnavi Bhargava, Debojyoti Dutta, Aryan Singhal

机构 * Nutanix

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15428 2025-07-22 cs.CV cs.AI 79%

EgoPrune: Efficient Token Pruning for Egomotion Video Reasoning in Embodied Agent

Jiaao Li, Kaiyuan Li, Chen Gao, Yong Li, Xinlei Chen

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06829 2025-07-10 cs.CL 79%

Adaptive Termination for Multi-round Parallel Reasoning: An Universal Semantic Entropy-Guided Framework

Zenan Xu, Zexuan Qiu, Guanhua Huang, Kun Li, Siheng Li, Chenchen Zhang, Kejiao Li, Qi Yi, Yuhao Jiang, Bo Zhou, Fengzong Lian, Zhanhui Kang

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL

Comments 13 pages, 5 fiures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01921 2025-07-03 cs.CL 79%

NaturalThoughts: Selecting and Distilling Reasoning Traces for General Reasoning Tasks

Yang Li, Youssef Emad, Karthik Padthe, Jack Lanchantin, Weizhe Yuan, Thao Nguyen, Jason Weston, Shang-Wen Li, Dong Wang, Ilia Kulikov, Xian Li

机构 * FAIR at Meta(Meta旗下的FAIR)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.06737 2025-06-30 cs.LG 79%

VersaPRM: Multi-Domain Process Reward Model via Synthetic Reasoning Data

Thomas Zeng, Shuibai Zhang, Shutong Wu, Christian Classen, Daewon Chae, Ethan Ewer, Minjae Lee, Heeju Kim, Wonjun Kang, Jackson Kunde, Ying Fan, Jungtaek Kim, Hyung Il Koo, Kannan Ramchandran, Dimitris Papailiopoulos, Kangwook Lee

机构 * University of Wisconsin--Madison(威斯康星大学麦迪逊分校) Korea University(韩国大学) University of California, Berkeley(加州大学伯克利分校)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12928 2025-06-17 cs.AI 79%

Scaling Test-time Compute for LLM Agents

King Zhu, Hanhao Li, Siwei Wu, Tianshun Xing, Dehua Ma, Xiangru Tang, Minghao Liu, Jian Yang, Jiaheng Liu, Yuchen Eleanor Jiang, Changwang Zhang, Chenghua Lin, Jun Wang, Ge Zhang, Wangchunshu Zhou

专题命中 测试时计算 :test-time compute(title);reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00027 2025-06-03 cs.CL 79%

From Mathematical Reasoning to Code: Generalization of Process Reward Models in Test-Time Scaling

Zhengyu Chen, Yudong Wang, Teng Xiao, Ruochen Zhou, Xuesheng Yang, Wei Wang, Zhifang Sui, Jingang Wang

机构 * Meituan Inc.(美团公司) National Key Laboratory for Multimedia Information Processing, Peking University(北京大学多媒体信息处理国家重点实验室) Pennsylvania State University(宾夕法尼亚大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24863 2025-06-02 cs.CL 79%

AlphaOne: Reasoning Models Thinking Slow and Fast at Test Time

Junyu Zhang, Runpei Dong, Han Wang, Xuying Ning, Haoran Geng, Peihao Li, Xialin He, Yutong Bai, Jitendra Malik, Saurabh Gupta, Huan Zhang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) UC Berkeley(伯克利加州大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17667 2025-05-28 cs.CL 79%

QwenLong-L1: Towards Long-Context Large Reasoning Models with Reinforcement Learning

Fanqi Wan, Weizhou Shen, Shengyi Liao, Yingcheng Shi, Chenliang Li, Ziyi Yang, Ji Zhang, Fei Huang, Jingren Zhou, Ming Yan

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17218 2025-05-26 cs.AI 79%

Effective Reinforcement Learning for Reasoning in Language Models

Lianghuan Huang, Shuo Li, Sagnik Anupam, Insup Lee, Osbert Bastani

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏