arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 2006 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 2006 篇

2507.15844 2025-08-08 cs.AI cs.CL 84%

Hierarchical Budget Policy Optimization for Adaptive Reasoning

Shangke Lyu, Linjuan Wu, Yuchen Yan, Xingyu Wu, Hao Li, Yongliang Shen, Peisheng Jiang, Weiming Lu, Jun Xiao, Yueting Zhuang

机构 * Zhejiang University(浙江大学) SF Technology(SF科技)

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

Comments Code: https://github.com/zju-real/hbpo Project Page:https://zju-real.github.io/hbpo/

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01633 2025-06-26 cs.LG cs.AI 84%

Adversarial Reasoning at Jailbreaking Time

Mahdi Sabbaghi, Paul Kassianik, George Pappas, Yaron Singer, Amin Karbasi, Hamed Hassani

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 测试时计算 :reasoning(title,abstract);test-time compute(abstract);分类 cs.AI、cs.LG

Comments Accepted to the 42nd International Conference on Machine Learning (ICML 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19830 2025-06-25 cs.LG cs.CL 84%

Scaling Speculative Decoding with Lookahead Reasoning

Yichao Fu, Rui Ge, Zelei Shao, Zhijie Deng, Hao Zhang

机构 * UCSD(加州大学圣地亚哥分校) Shanghai Jiao Tong University(上海交通大学) UIUC(伊利诺伊大学香槟分校)

专题命中 测试时计算 :reasoning(title,abstract);verifier(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13585 2025-06-17 cs.CL cs.LG 84%

MiniMax-M1: Scaling Test-Time Compute Efficiently with Lightning Attention

MiniMax, :, Aili Chen, Aonian Li, Bangwei Gong, Binyang Jiang, Bo Fei, Bo Yang, Boji Shan, Changqing Yu, Chao Wang, Cheng Zhu, Chengjun Xiao, Chengyu Du, Chi Zhang, Chu Qiao, Chunhao Zhang, Chunhui Du, Congchao Guo, Da Chen, Deming Ding, Dianjun Sun, Dong Li, Enwei Jiao, Haigang Zhou, Haimo Zhang, Han Ding, Haohai Sun, Haoyu Feng, Huaiguang Cai, Haichao Zhu, Jian Sun, Jiaqi Zhuang, Jiaren Cai, Jiayuan Song, Jin Zhu, Jingyang Li, Jinhao Tian, Jinli Liu, Junhao Xu, Junjie Yan, Junteng Liu, Junxian He, Kaiyi Feng, Ke Yang, Kecheng Xiao, Le Han, Leyang Wang, Lianfei Yu, Liheng Feng, Lin Li, Lin Zheng, Linge Du, Lingyu Yang, Lunbin Zeng, Minghui Yu, Mingliang Tao, Mingyuan Chi, Mozhi Zhang, Mujie Lin, Nan Hu, Nongyu Di, Peng Gao, Pengfei Li, Pengyu Zhao, Qibing Ren, Qidi Xu, Qile Li, Qin Wang, Rong Tian, Ruitao Leng, Shaoxiang Chen, Shaoyu Chen, Shengmin Shi, Shitong Weng, Shuchang Guan, Shuqi Yu, Sichen Li, Songquan Zhu, Tengfei Li, Tianchi Cai, Tianrun Liang, Weiyu Cheng, Weize Kong, Wenkai Li, Xiancai Chen, Xiangjun Song, Xiao Luo, Xiao Su, Xiaobo Li, Xiaodong Han, Xinzhu Hou, Xuan Lu, Xun Zou, Xuyang Shen, Yan Gong, Yan Ma, Yang Wang, Yiqi Shi, Yiran Zhong, Yonghong Duan, Yongxiang Fu, Yongyi Hu, Yu Gao, Yuanxiang Fan, Yufeng Yang, Yuhao Li, Yulin Hu, Yunan Huang, Yunji Li, Yunzhi Xu, Yuxin Mao, Yuxuan Shi, Yuze Wenren, Zehan Li, Zelin Li, Zhanxu Tian, Zhengmao Zhu, Zhenhua Fan, Zhenzhen Wu, Zhichao Xu, Zhihang Yu, Zhiheng Lyu, Zhuo Jiang, Zibo Gao, Zijia Wu, Zijian Song, Zijun Sun

机构 * MiniMax

专题命中 测试时计算 :test-time compute(title,abstract);reasoning(abstract);分类 cs.CL、cs.LG

Comments A technical report from MiniMax. The authors are listed in alphabetical order. We open-source our MiniMax-M1 at https://github.com/MiniMax-AI/MiniMax-M1

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12123 2025-06-09 cs.CL cs.LG 84%

On the Query Complexity of Verifier-Assisted Language Generation

Edoardo Botta, Yuchen Li, Aashay Mehta, Jordan T. Ash, Cyril Zhang, Andrej Risteski

机构 * Carnegie Mellon University(卡内基梅隆大学) Microsoft Research NYC(微软研究院纽约)

专题命中 测试时计算 :verifier(title,abstract);reasoning(abstract);分类 cs.CL、cs.LG

Comments ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04824 2025-06-06 cs.CL cs.AI 84%

A Reasoning-Based Approach to Cryptic Crossword Clue Solving

Martin Andrews, Sam Witteveen

专题命中 测试时计算 :reasoning(title,abstract);verifier(abstract);分类 cs.CL、cs.AI

Comments 9 page paper plus Appendices. Accepted to ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19621 2025-05-27 cs.AI cs.CL 84%

Think Again! The Effect of Test-Time Compute on Preferences, Opinions, and Beliefs of Large Language Models

George Kour, Itay Nakash, Ateret Anaby-Tavor, Michal Shmueli-Scheuer

机构 * IBM Research AI(IBM人工智能研究)

专题命中 测试时计算 :test-time compute(title,abstract);reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.00163 2025-04-02 cs.CL cs.AI 84%

Does "Reasoning" with Large Language Models Improve Recognizing, Generating, and Reframing Unhelpful Thoughts?

Yilin Qi, Dong Won Lee, Cynthia Breazeal, Hae Won Park

专题命中 测试时计算 :reasoning(title,abstract);CoT(abstract);分类 cs.CL、cs.AI

Comments 8 pages, 3 figures (including appendix)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22989 2025-04-01 cs.AI cs.CL 84%

FindTheFlaws: Annotated Errors for Detecting Flawed Reasoning and Scalable Oversight Research

Gabriel Recchia, Chatrik Singh Mangat, Issac Li, Gayatri Krishnakumar

专题命中 测试时计算 :reasoning(title,abstract);verifier(abstract);分类 cs.CL、cs.AI

Comments 43 pages, 3 figures. for associated repository, see https://github.com/modulo-research/findtheflaws

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05944 2025-03-11 cs.AI cs.LG 84%

Enhancing Reasoning with Collaboration and Memory

Julie Michelman, Nasrin Baratalipour, Matthew Abueg

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG

Comments 17 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.20372 2025-03-03 cs.CL cs.AI 84%

LLM2: Let Large Language Models Harness System 2 Reasoning

Cheng Yang, Chufan Shi, Siheng Li, Bo Shui, Yujiu Yang, Wai Lam

专题命中 测试时计算 :reasoning(title,abstract);verifier(abstract);分类 cs.CL、cs.AI

Comments Accepted to NAACL 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.02864 2024-11-06 cs.CL cs.AI cs.IR 84%

Graph-DPEP: Decomposed Plug and Ensemble Play for Few-Shot Document Relation Extraction with Graph-of-Thoughts Reasoning

Tao Zhang, Ning Yan, Masood Mortazavi, Hoang H. Nguyen, Zhongfen Deng, Philip S. Yu

专题命中 测试时计算 :reasoning(title,abstract);verifier(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.09671 2024-10-15 cs.AI cs.CL 84%

OpenR: An Open Source Framework for Advanced Reasoning with Large Language Models

Jun Wang, Meng Fang, Ziyu Wan, Muning Wen, Jiachen Zhu, Anjie Liu, Ziqin Gong, Yan Song, Lei Chen, Lionel M. Ni, Linyi Yang, Ying Wen, Weinan Zhang

专题命中 测试时计算 :reasoning(title,abstract);test-time compute(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.13149 2024-08-30 cs.CL cs.AI 84%

Beyond Self-Consistency: Ensemble Reasoning Boosts Consistency and Accuracy of LLMs in Cancer Staging

Chia-Hsuan Chang, Mary M. Lucas, Yeawon Lee, Christopher C. Yang, Grace Lu-Yao

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

Comments accepted to the 22nd International Conference on Artificial Intelligence in Medicine (AIME'24)

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.03314 2024-08-07 cs.LG cs.CL 84%

Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters

Charlie Snell, Jaehoon Lee, Kelvin Xu, Aviral Kumar

专题命中 测试时计算 :test-time compute(title,abstract);verifier(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.03748 2024-02-20 cs.CL cs.AI 84%

Applying Large Language Models and Chain-of-Thought for Automatic Scoring

Gyeong-Geon Lee, Ehsan Latif, Xuansheng Wu, Ninghao Liu, Xiaoming Zhai

专题命中 测试时计算 :chain-of-thought(title);reasoning(abstract);CoT(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.10480 2024-01-22 cs.CL cs.AI 84%

Escape Sky-high Cost: Early-stopping Self-Consistency for Multi-step Reasoning

Yiwei Li, Peiwen Yuan, Shaoxiong Feng, Boyuan Pan, Xinglin Wang, Bin Sun, Heda Wang, Kan Li

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

Comments ICLR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.02336 2023-05-25 cs.CL cs.AI 84%

Making Large Language Models Better Reasoners with Step-Aware Verifier

Yifei Li, Zeqi Lin, Shizhuo Zhang, Qiang Fu, Bei Chen, Jian-Guang Lou, Weizhu Chen

专题命中 测试时计算 :verifier(title,abstract);reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2203.11171 2023-03-08 cs.CL cs.AI 84%

Self-Consistency Improves Chain of Thought Reasoning in Language Models

Xuezhi Wang, Jason Wei, Dale Schuurmans, Quoc Le, Ed Chi, Sharan Narang, Aakanksha Chowdhery, Denny Zhou

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

Comments Published at ICLR 2023. V2: added PaLM results; V3: added UL2 results; V4: camera ready version at ICLR 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18532 2026-07-22 cs.CL 新提交 84%

Reasoning Fine-Tuning Induces Persistent Latent Policy States

推理微调诱导持久的潜在策略状态

Abir Harrasse, Michael Lan, Hunar Batra, Fateme Hashemi Chaleshtori, Chaithanya Bandi

机构 * University of Oxford(牛津大学) University of Utah(犹他大学)

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL;CoT(comments)

AI总结 研究推理微调对语言模型的影响,将思维链推理建模为切换动态系统,通过时间感知对比表征学习等方法恢复潜在策略。发现推理微调使模型有更丰富的潜在策略组织,恢复的状态有功能意义,SDS引导的剪枝效果良好,为推理模型分析和控制提供新视角。

Comments Accepted at the Conference on Language Modeling (COLM) 2026. 45 pages, including appendices; 24 figures and 12 tables. Code: https://github.com/withmartian/mi-cot

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21067 2025-10-27 cs.LG 84%

The Virtues of Brevity: Avoid Overthinking in Parallel Test-Time Reasoning

Raul Cavalcante Dinardi, Bruno Yamamoto, Anna Helena Reali Costa, Artur Jordao

机构 * Instituto de Matemática, Estatística e Ciência da Computação, Universidade de São Paulo(圣保罗大学数学、统计与计算机科学研究所) Escola Politécnica, Universidade de São Paulo(圣保罗大学理工学院)

专题命中 测试时计算 :reasoning(title,abstract);test-time compute(abstract);分类 cs.LG

Comments Accepted at NeurIPS 2025 Workshop on Efficient Reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10660 2026-04-14 cs.CL cs.AI cs.LG 83%

Efficient Process Reward Modeling via Contrastive Mutual Information

通过对比互信息实现高效的进程奖励建模

Nakyung Lee, Sangwoo Hong, Jungwoo Lee

机构 * Department of Electrical and Computer Engineering, Seoul National University(首尔大学电气与计算机工程系) Department of Computer Science and Engineering, Konkuk University(建国大学计算机科学与工程系)

专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);verifier(abstract)

AI总结 本文提出CPMI方法,通过模型内部概率推断步骤监督,减少标注计算负担,提升过程级评估和数学推理准确性。

Comments Accepted at ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03244 2025-12-04 cs.LG cs.AI cs.CL 83%

SPARK: Stepwise Process-Aware Rewards for Reference-Free Reinforcement Learning

SPARK:基于过程的奖励机制用于无参考强化学习

Salman Rahman, Sruthi Gorantla, Arpit Gupta, Swastik Roy, Nanyun Peng, Yang Liu

机构 * Amazon AGI(亚马逊人工智能实验室) UCLA(大学)

专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);verifier(abstract)

AI总结 SPARK提出一种无参考强化学习框架,通过生成和验证模型提升过程奖励模型性能,在数学推理任务中取得优于真实参考的方法的成果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19807 2026-08-21 cs.LG 新提交 83%

Answer-Level Trust Selection for Physical Vision-Language Reasoning

面向物理视觉-语言推理的答案级信任选择

Rongyu Yu, Ke Niu, Fengxiang He

专题命中 测试时计算 :reasoning(title,abstract);verifier(abstract);分类 cs.LG

AI总结 针对VLM部署中预测信任问题,提出模型无关的ATS框架,聚合8种诊断分数评估答案可靠性,可识别稳定错判等失效模式,补充模型级能力评估。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06245 2026-08-21 cs.RO cs.AI 版本更新 83%

MPCoT: Reward-Guided Multi-Path Latent Reasoning for Test-Time Scalable Vision-Language-Action

MPCoT: 奖励引导的多路径潜在推理用于测试时可扩展的视觉-语言-动作

Boyang Zhang, Lianlei Shan

机构 * Department of Electrical and Computer Engineering, Boston University(波士顿大学电气与计算机工程系) Department of Computer Science, Tsinghua University(清华大学计算机系)

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 提出MPCoT框架,通过奖励引导的多路径潜在推理,在保持零推理令牌和原始动作接口的同时,提升长时域和高不确定性控制任务中的VLA策略性能。

Comments 14 pages, 5 figures, submitted to CoRL

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09706 2026-08-17 cs.CE cs.LG 版本更新 83%

Test-Time Scaling for CAD Generation via Verifier-Free Consensus Selection

基于无验证器共识选择的CAD生成测试时缩放

Aaron Haag, Altay Kacan, Bertram Fuchs, Oliver Lohse

专题命中 测试时计算 :verifier(title,abstract);test-time compute(abstract);分类 cs.LG

AI总结 该研究针对文本到CAD生成的单个样本易出错问题,提出无验证器的3D CAD共识选择方法,经实验验证其可提升几何准确率并降低Chamfer距离。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10665 2026-08-12 cs.AI cs.CV cs.GT 新提交 83%

VERDICT: Training-Free Step-Wise Verification of Multimodal Reasoning via Disagreement-Aware Consensus

VERDICT:基于分歧感知共识的多模态推理无训练逐步验证方法

Rohit Sinha, Kunal Tilaganji, Tanuja Ganu, Nagarajan Natarajan, Amit Sharma, Vineeth Balasubramanian

机构 * Indian Institute of Technology, Hyderabad(印度理工学院海得拉巴分校) Microsoft Research(微软研究院)

专题命中 测试时计算 :reasoning(title,abstract);verifier(abstract);分类 cs.AI

AI总结 该研究针对多模态大语言模型推理链易出错的问题,提出无训练的VERDICT方法,利用跨模态分歧的闭式解计算共识评分,在六个基准上提升最高达5.95%,性能接近需大量监督的特定领域评论家。

Comments European Conference on Computer Vision 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08020 2026-08-12 cs.AI 版本更新 83%

Thought-Level Beam Search for Reasoning

用于推理的思维级束搜索

Lijie Yang, Hongyin Luo, Jiawei Zhao, Tri Dao, Ravi Netravali

机构 * Princeton University(普林斯顿大学) MIT(麻省理工学院) Meta AI

专题命中 测试时计算 :reasoning(title,abstract);test-time compute(abstract);分类 cs.AI

AI总结 针对大型推理模型测试时计算分配的低效问题,提出执行思维级束搜索的Gambit算法,在固定硬件预算下,其在准确率、吞吐量、token消耗等指标上均优于现有基线方法。

Comments Add the author Jiawei Zhao in Meta Data

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05307 2026-08-12 cs.CL 版本更新 83%

MentorCollab: Large-to-Small Inference-Time Mentorship for Concise Reasoning in Language Models

MentorCollab: 选择性大到小推理时指导以实现高效推理

Haojin Wang, Yike Wang, Shangbin Feng, Hannaneh Hajishirzi, Yulia Tsvetkov

机构 * UIUC(伊利诺伊大学香槟分校) University of Washington(华盛顿大学) Allen Institute for Artificial Intelligence(人工智能研究院)

专题命中 测试时计算 :reasoning(title,abstract);verifier(abstract);分类 cs.CL

AI总结 MentorCollab通过选择性推理时指导,使小型模型在多步骤推理任务中实现高效协作,提升性能的同时降低计算开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03438 2026-08-03 cs.AI 版本更新 83%

Multimodal Reinforcement Learning with Adaptive Verifier for AI Agents

具有自适应验证器的多模态强化学习

Reuben Tan, Baolin Peng, Zhengyuan Yang, Hao Cheng, Oier Mees, Theodore Zhao, Andrea Tupini, Isar Meijer, Qianhui Wu, Yuncong Yang, Lars Liden, Yu Gu, Sheng Zhang, Xiaodong Liu, Lijuan Wang, Marc Pollefeys, Yong Jae Lee, Jianfeng Gao

机构 * Microsoft Research(微软研究院) UMass Amherst(马萨诸塞大学阿默斯特分校) ETH Zurich(苏黎世联邦理工学院) UW–Madison(威斯康星大学麦迪逊分校)

专题命中 测试时计算 :verifier(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 本文提出Argos验证器,通过结合SFT数据筛选与RL训练,提升多模态推理模型在空间推理、视觉幻觉及机器人任务中的性能,同时减少奖励黑客问题。

详情

展开后加载摘要…

URL PDF HTML 收藏