arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 2030 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 2030 篇

2605.26172 2026-05-27 cs.LG 79%

ARBITER: Reasoning Trajectory Basins and Majority Vote Failures in Test-Time Sampling

ARBITER:测试时采样中的推理轨迹盆地与多数投票失败

Meng Cai, Lars Kulik, Farhana Choudhury

机构 * School of Computing and Information Systems(计算与信息系统学院) University of Melbourne(墨尔本大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.LG

AI总结 本文发现语言模型测试时采样的推理轨迹会聚集成少数“推理盆地”,导致多数投票选择最稳定而非最准确的盆地,并提出ARBITER方法通过保守加性证据修正共识,从样本池中恢复部分正确性。

Comments Preprint. 34 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13502 2026-05-27 cs.CL 79%

Using reasoning LLMs to extract SDOH events from clinical notes

使用推理型大语言模型从临床笔记中提取社会健康决定因素事件

Ertan Dogan, Kunyu Yu, Yifan Peng

机构 * Department of Population Health Sciences, Weill Cornell Medicine(流行病学与公共卫生系,韦尔·科恩医学中心)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL

AI总结 本研究提出一种基于推理型大语言模型的提示工程方法,通过四个模块(简洁提示、少样本学习、自一致性机制和后处理)从临床笔记中提取结构化SDOH事件,取得0.866的微平均F1分数,展示了简单实现与强性能的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24998 2026-05-26 cs.CL 79%

Better, Faster: Harnessing Self-Improvement in Large Reasoning Models

更好、更快:利用大型推理模型的自我改进

Qihuang Zhong, Liang Ding, Juhua Liu, Bo Du, Leszek Rutkowski, Dacheng Tao

机构 * Nanyang Technological University, Singapore(新加坡南洋理工大学) Alibaba Group, China(中国阿里巴巴集团) School of Computer Science, Wuhan University, China(武汉大学计算机学院) AGH University of Science and Technology, Poland(波兰AGH科学与技术大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL

AI总结 针对自我改进训练中数据不平衡和过度思考问题,提出HSIR方法,通过验证后退出采样和内在多样性评分提升推理性能与效率。

Comments Accepted by ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21810 2026-05-22 cs.AI cs.MA 79%

Trace2Skill: Verifier-Guided Skill Evolution for Long-Context EDA Agents

Trace2Skill: 验证器引导的技能进化用于长上下文EDA代理

Zijian Du, Nathaniel Pinckney

机构 * NVIDIA

专题命中 测试时计算 :verifier(title,abstract);分类 cs.AI

AI总结 本文提出Trace2Skill框架,通过验证器引导的技能进化提升硬件代理在复杂验证问题上的性能,无需RTL专用模型微调,通过密集验证器反馈实现任务通过率的显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19376 2026-05-21 cs.AI 79%

Generative Recursive Reasoning

生成性递归推理

Junyeob Baek, Mingyu Jo, Minsu Kim, Mengye Ren, Yoshua Bengio, Sungjin Ahn

机构 * KAIST(韩国科学技术院) Mila – Québec AI Institute(魁北克人工智能研究所) New York University(纽约大学) Université de Montréal(蒙特利尔大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出Gram框架,通过将递归潜在推理转化为概率多轨迹计算,解决了传统递归推理模型的确定性问题,实现了条件推理和无条件生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17626 2026-05-19 cs.LG cs.SE 79%

Verifier-Guided Code Translation via Meta-Step Decoding

通过元步骤解码实现验证器引导的代码翻译

Tianyang Zhou, Somesh Jha, Mihai Christodorescu, Kirill Levchenko, Varun Chandrasekaran

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Google(谷歌)

专题命中 测试时计算 :verifier(title,abstract);分类 cs.LG

AI总结 本研究提出了一种元步骤解码框架DTV,通过在生成过程中整合验证器调用,提高了代码翻译的通过率,同时减少了token的使用。

Comments 31 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22297 2026-05-19 cs.CL 79%

Learning from Self-Debate: Preparing Reasoning Models for Multi-Agent Debate

从自我辩论中学习:为多智能体辩论准备推理模型

Chenxi Liu, Yanshuo Chen, Ruibo Chen, Tianyi Xiong, Tong Zheng, Heng Huang

机构 * Department of Computer Science(计算机科学系)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出SDRL框架,通过自我辩论训练使模型具备独立问题解决能力和多智能体辩论中的多样化推理处理能力,实验表明其在多辩论协议和智能体配置下均能提升多智能体辩论性能和单模型推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17104 2026-05-19 cs.AI 79%

Scientific Logicality Enriched Methodology for LLM Reasoning: A Practice in Physics

具有科学逻辑性的方法论:LLM推理的实践:物理学

Zhaoxin Yu, Nan Xu, Kun Chen, Jiahao Zhao, Lei Wang, Wenji Mao

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences, Beijing, China Beijing Wenge Technology Co., Ltd, Beijing, China School of Artificial Intelligence, University of Chinese Academy of Sciences, Beijing, China

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出了一种增强科学逻辑性的方法论,旨在提升LLM在科学推理中的逻辑正确性与任务表现,通过物理学中的多样逻辑结构和形式化进行实践验证。

Comments Accepted to the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12987 2026-05-19 cs.CL 79%

Leveraging Multimodal Self-Consistency Reasoning in Coding Motivational Interviewing for Alcohol Use Reduction

利用多模态自一致性推理进行编码动机访谈以减少酒精使用

Guangzeng Han, James G. Murphy, Benjamin O. Ladd, Xiaolei Huang, Brian Borsari

机构 * Department of Computer Science, University of Memphis(密苏里大学计算机科学系) Veterans Affairs Health Care System(退伍军人事务医疗系统) Department of Psychiatry and Behavioral Sciences, University of California San Francisco(旧金山大学精神病学与行为科学系) Department of Psychology, University of Memphis(密苏里大学心理学系) Department of Psychology, Washington State University Vancouver(华盛顿州立大学温哥华分校心理学系)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出基于音频语言模型的自动动机访谈编码方法,通过多模态自一致性推理提升编码鲁棒性,实验显示其在准确率、精确率和召回率上均优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02427 2026-05-15 cs.LG 79%

Embedding Perturbation may Better Reflect Intermediate-Step Uncertainty in LLM Reasoning

嵌入扰动可能更好地反映大语言模型推理中的中间步骤不确定性

Qihao Wen, Jiahao Wang, Yang Nan, Pengfei He, Ravi Tandon, Han Xu

机构 * University of Arizona(亚利桑那大学) Michigan State University(密歇根州立大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.LG

AI总结 本文研究了大语言模型推理中中间步骤不确定性的量化方法,发现基于嵌入扰动的指标在不确定性评估中表现更优,具有更高的效率和简洁性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13501 2026-05-14 cs.AR cs.LG 79%

Reward-Weighted On-Policy Distillation with an Open Property-Equivalence Verifier for NL-to-SVA Generation

基于开放属性等价验证器的奖励加权在线策略蒸馏用于自然语言到SVA生成

Qingyun Zou, Yingze Li, Tianen Liu, Bingsheng He, Weng-Fai Wong

机构 * National University of Singapore(新加坡国立大学)

专题命中 测试时计算 :verifier(title,abstract);分类 cs.LG

AI总结 本文提出RWOPD方法,通过开放属性等价检查器提升SVA生成性能,使模型在多个评估指标上超越现有最佳模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10762 2026-05-12 cs.CV cs.AI 79%

GridProbe: Posterior-Probing for Adaptive Test-Time Compute in Long-Video VLMs

GridProbe: 为长视频VLMs中的自适应测试时间计算进行后验探测

Mohamed Eltahir, Lama Ayash, Ali Habibullah, Tanveer Hussain, Naeemullah Khan

机构 * King Abdullah University of Science and Technology (KAUST)(卡尔斯塔德大学科学与技术学院) Department of Computer Science, Edge Hill University(埃奇希尔大学计算机科学系)

专题命中 测试时计算 :test-time compute(title);reasoning(abstract);分类 cs.AI

AI总结 GridProbe通过后验探测方法在无需训练的情况下选择相关帧,减少注意力成本,同时保持高精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09853 2026-05-12 cs.LG 79%

Exploration-Driven Optimization for Test-Time Large Language Model Reasoning

基于探索的优化用于测试时大语言模型推理

Changhao Li, Yuchen Zhuang, Chenxiao Gao, Haotian Sun, Rushi Qiang, Chao Zhang, Bo Dai

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.LG

AI总结 本文提出EDO框架,通过扩展奖励偏差探索目标到迭代后训练,提升大语言模型推理中的探索与利用平衡,实验表明ED-iDPO和ED-GRPO在推理能力和多样性上优于基线模型。

Comments Accepted by TMLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08776 2026-05-12 cs.AI 79%

Reasoning Compression with Mixed-Policy Distillation

基于混合策略蒸馏的推理压缩

Han Yang, Mingyan Wu, Bailan He, Zeyu Cao, Sikuan Yan, Kevin Qinghong Lin, Zifeng Ding

机构 * Technical University of Munich(慕尼黑技术大学) GESIS – Leibniz Institute for the Social Sciences(莱布尼茨社会科学研究所) Northeastern University(东北大学) LMU Munich(慕尼黑大学) Siemens AG(西门子股份公司) University of Cambridge(剑桥大学) University of Oxford(牛津大学) Mina AI

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出混合策略蒸馏框架,通过从大模型压缩推理轨迹到小模型,有效减少token使用并提升推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08478 2026-05-12 cs.LG 79%

When Independent Sampling Outperforms Agentic Reasoning

独立采样优于代理推理

Yihe Dong, Boris Shigida

机构 * Princeton University(普林斯顿大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.LG

AI总结 本文研究在固定预算下如何分配推理时间计算以提高编程竞赛表现,发现独立采样在准确率与成本、查询数的权衡上优于代理推理,且在资源受限条件下独立探索更有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08070 2026-05-11 cs.AI 79%

VecCISC: Improving Confidence-Informed Self-Consistency with Reasoning Trace Clustering and Candidate Answer Selection

VecCISC:通过推理轨迹聚类和候选答案选择改进置信度引导的自一致性

James Petullo, Sonny George, Dylan Cashman, Nianwen Xue

机构 * Computer Science Department, Brandeis University(布拉德雷大学计算机科学系)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI

AI总结 VecCISC通过推理轨迹聚类和候选答案筛选优化置信度引导的自一致性方法,减少计算开销并保持高精度。

Comments Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26954 2026-05-01 cs.CY cs.AI 79%

The Impact of LLM Self-Consistency and Reasoning Effort on Automated Scoring Accuracy and Cost

大型语言模型自我一致性与推理努力对自动化评分准确性和成本的影响

Scott Frohn

机构 * Khan Academy(可汗学院)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI

AI总结 研究探讨了LLM自我一致性和推理努力对自动化评分准确性和成本的影响,发现策略性模型选择和推理设置比集成更有效,且推理努力与评分准确性呈正相关。

Comments 14 pages, 10 tables, 2 figures. Presented at the 2026 National Council on Measurement in Education (NCME) Annual Meeting, April 11, 2026, Los Angeles, CA

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25444 2026-04-29 cs.CL 79%

One Refiner to Unlock Them All: Inference-Time Reasoning Elicitation via Reinforcement Query Refinement

一个refiner解锁所有:通过强化查询细化实现推理时间推理 elicitation

Yixiao Zhou, Dongzhou Cheng, zhiliang wu, Yi Yang, Yu Cheng, Hehe Fan

机构 * Zhejiang University(浙江大学) Shanghai Innovation Institute(上海创新研究院) Southeast University(东南大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出ReQueR框架,通过强化学习训练专门的Refiner策略,将推理 elicitation作为推理时间对齐任务,实现对多种模型的推理能力解锁,提升性能2.1%。

Comments Accepted to ACL26

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00626 2026-04-28 cs.SD cs.CL 79%

When Silence Matters: The Impact of Irrelevant Audio on Text Reasoning in Large Audio-Language Models

沉默也重要:无关音频对大音频-语言模型文本推理的影响

Chen-An Li, Tzu-Han Lin, Hung-yi Lee

机构 * National Taiwan University(国立台湾大学) NTU Artificial Intelligence Center of Research Excellence(国立成功大学人工智能研究中心)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL

AI总结 研究探讨无关音频对大音频-语言模型文本推理的影响,发现非信息性音频会降低准确率并增加预测波动,提出自一致性策略能提升稳定性但增加计算成本。

Comments Accepted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19444 2026-04-22 cs.LG 79%

Unsupervised Confidence Calibration for Reasoning LLMs from a Single Generation

无监督的置信度校准用于推理语言模型:从单次生成出发

Thomas Zollo, Jimmy Wang, Richard Zemel

机构 * Columbia University(哥伦比亚大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.LG

AI总结 本文提出一种无监督置信度校准方法,通过单次生成数据提升推理语言模型的置信度估计,经多任务评估显著优于基线方法,提升下游任务表现。

Comments 41 pages, 14 tables, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18464 2026-04-21 cs.LG 79%

Semantic Step Prediction: Multi-Step Latent Forecasting in LLM Reasoning Trajectories via Step Sampling

语义步预测:通过步采样进行LLM推理轨迹中的多步潜在预测

Yidi Yuan

机构 * Home Team Science and Technology Agency(家庭团队科技机构)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.LG

AI总结 本文通过步采样改进语义管预测方法,提升多步潜在预测的准确性,并提出新的评估指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17884 2026-04-21 cs.AI 79%

SPREG: Structured Plan Repair with Entropy-Guided Test-Time Intervention for Large Language Model Reasoning

SPREG:基于熵引导的测试时干预的结构化计划修复用于大语言模型推理

Xuan Wang, Yu Ming, Xinhao Zhong, Xinyu Yu, Wenjie Wang, Shuai Chen, Wei Lin

机构 * Meituan(美团)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI

AI总结 SPREG通过熵引导的测试时干预,解决大语言模型在长链推理中的逻辑幻觉和随机漂移问题,通过动态修复机制提升推理准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15614 2026-04-20 cs.LG 79%

Flexible Empowerment at Reasoning with Extended Best-of-N Sampling

灵活的推理赋能与扩展的Best-of-N采样

Taisuke Kobayashi

机构 * National Institute of Informatics and The Graduate University for Advanced Studies, SOKENDAI Japan(日本信息处理研究所和高级研究大学研究院(SOKENDAI))

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.LG

AI总结 本文提出一种结合赋能的推理方法,通过扩展Best-of-N采样解决探索-利用困境,改进了传统奖励函数中延迟学习的问题。

Comments 15 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01544 2026-04-14 cs.AI 79%

Advancing Reasoning in Diffusion Language Models with Denoising Process Rewards

通过去噪过程奖励推进扩散语言模型的推理能力

Shaoan Xie, Lingjing Kong, Xiangchen Song, Xinshuai Dong, Guangyi Chen, Eric P. Xing, Kun Zhang

机构 * Carnegie Mellon University(卡内基梅隆大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出去噪过程奖励,通过优化去噪轨迹提升扩散语言模型的推理稳定性与可解释性,实验显示在推理任务中表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21872 2026-04-10 cs.AI 79%

WebArbiter: A Principle-Guided Reasoning Process Reward Model for Web Agents

WebArbiter: 一种基于原则的推理过程奖励模型用于网络代理

Yao Zhang, Shijie Tang, Zeyu Li, Zhen Han, Volker Tresp

机构 * LMU Munich(慕尼黑大学) Technical University of Munich(慕尼黑工业大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出WebArbiter,一种基于原则的推理过程奖励模型,用于网络导航任务。该模型通过文本生成产生结构化的解释,以指导任务完成。通过两阶段训练流程,提升模型的泛化能力,并在WebPRMBench基准测试中优于现有方法。

Comments Published as a conference paper at ICLR 2026. Extended version with additional experiments

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06389 2026-04-09 cs.AI 79%

SELFDOUBT: Uncertainty Quantification for Reasoning LLMs via the Hedge-to-Verify Ratio

SELFDOUBT:通过Hedge-to-Verify比率对推理大语言模型进行不确定性量化

Satwik Pandey, Suresh Raghu, Shashwat Pandey

机构 * Independent Researcher(独立研究员) Zillow Group(Zillow集团)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI

AI总结 SELFDOUBT是一种单次通过的不确定性框架,通过从推理轨迹中提取行为信号解决推理大语言模型的不确定性量化问题,其核心信号Hedge-to-Verify比率能检测推理轨迹中的不确定性标记及自我检查行为,适用于任何私有API的部署。

Comments 9 pages, 4 figures, 4 tables, plus appendix. Submitted to COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05868 2026-04-08 cs.CL 79%

Understanding Performance Gap Between Parallel and Sequential Sampling in Large Reasoning Models

理解并行采样与顺序采样在大推理模型中的性能差距

Xiangming Gu, Soham De, Larisa Markeeva, Petar Veličković, Razvan Pascanu

机构 * Google DeepMind(谷歌DeepMind) National University of Singapore(新加坡国立大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL

AI总结 本文研究大推理模型中并行与顺序采样性能差异,发现并行采样表现更优,提出探索不足是主要原因。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08659 2026-04-07 cs.CL 79%

CODA: Difficulty-Aware Compute Allocation for Adaptive Reasoning

CODA:面向自适应推理的难度感知计算分配

Siye Wu, Jian Xie, Yikai Zhang, Yanghua Xiao

机构 * Fudan University(复旦大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出CODA,通过难度感知信号动态分配计算资源,实现自适应推理。在易任务中降低token成本,在难任务中提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27349 2026-03-31 cs.CV cs.CL 79%

Inference-Time Structural Reasoning for Compositional Vision-Language Understanding

推理时的结构推理用于组合性视觉-语言理解

Amartya Bhattacharya

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出统一评估和增强框架,评估四种架构各异的VLMs在Winoground基准上的表现,通过结构化关系先验提升模型能力,发现SG增强对已有能力强的模型有益。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10273 2026-03-24 stat.ML cs.LG 79%

Power-SMC: Low-Latency Sequence-Level Power Sampling for Training-Free LLM Reasoning

Power-SMC:低延迟序列级功率采样用于训练自由LLM推理

Seyedarmin Azizi, Erfan Baghaei Potraghloo, Minoo Ahmadi, Souvik Kundu, Massoud Pedram

机构 * University of Southern California(南加州大学) Intel Labs(英特尔实验室)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.LG

AI总结 本文提出Power-SMC,一种低延迟的序列级功率采样方法,用于训练自由的大语言模型推理,通过并行粒子集和重要权重修正提升推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏