arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 2030 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 2030 篇

2608.24087 2026-08-26 cs.LG cs.AI stat.ML 新提交 73%

Knowing When to Ask for Help: Bayesian Self-Escalation in Hierarchical LLM Agents

何时请求帮助:分层大语言模型智能体中的贝叶斯自我升级

Nadeem Shaikh

专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.AI、cs.LG

AI总结 该研究针对LLM智能体提出贝叶斯自我升级策略,将生成中委派建模为贝叶斯最优停止问题,经模拟和真实代码级联验证,其升级机制在同等成本下优于事后路由,能力信念区分度随生成提升。

Comments 21 pages, 5 figures. Code and data: https://github.com/nadeem-shaikh/llm-self-escalation . Associated record: https://doi.org/10.5281/zenodo.21330787

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00515 2026-08-04 cs.CR cs.AI cs.CL 新提交 73%

Auditable Release Control for Pedagogical Leakage in LLM Tutors

LLM辅导器中教学式泄露的可审计发布控制

Nizam Kadir

专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对LLM辅导器的教学式泄露问题,提出感知授权的可审计发布控制机制,经实验验证可显著降低泄露标记,且在安全与效用上优于基线方法。

Comments 9 pages, 1 figure, 6 tables. Preprint; not peer reviewed

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15040 2026-07-31 cs.AI cs.CL 版本更新 73%

Orchard: An Open-Source Agentic Modeling Framework

Orchard:一个开源的智能体建模框架

Baolin Peng, Wenlin Yao, Qianhui Wu, Hao Cheng, Xiao Yu, Rui Yang, Tao Ge, Alessandro Sordoni, Xingdi Yuan, Yelong Shen, Pengcheng He, Tong Zhang, Zhou Yu, Jianfeng Gao

机构 * Microsoft Research(微软研究院) Columbia University(哥伦比亚大学) UIUC(伊利诺伊大学香槟分校)

专题命中 测试时计算 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Orchard,一个开源的智能体建模框架,通过轻量级环境服务和三种智能体建模食谱,实现了跨领域可重用的智能体数据、训练和评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25069 2026-07-29 cs.CL cs.AI 新提交 73%

DS@GT ARC at CheckThat! 2026: LLM-Based Trace Ranking and Grouped Reward Modeling for Multilingual Numerical Claim Verification

DS@GT ARC在CheckThat! 2026中的应用:基于大语言模型的多语言数值声明验证的推理轨迹排序和分组奖励建模

Sagnik Sinha, Shreyas Shrestha

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.CL、cs.AI

AI总结 针对多语言数值声明验证,探索基于大语言模型(LLM)的推理轨迹排序和分组奖励建模两种方法。LLM方法用LoRA微调验证器评分,还尝试子声明分解;奖励模型用TF-IDF及特征评分。结果显示LLM方法多数指标更优,阿拉伯语中AraBERT表现更佳且子声明分解未提升性能。

Comments 10 pages, 2 figures. Accepted at CLEF 2026 CheckThat!. To appear in CEUR Workshop Proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17531 2026-07-21 cs.CL cs.AI 新提交 73%

Oracle Gap and Signal Fidelity: A Fixed-Pool Diagnostic for Test-Time Collaboration

预言机差距与信号保真度:一种用于测试时协作的固定池诊断方法

Jie Hu

机构 * Research Institute of China Telecom(中国电信研究院)

专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.CL、cs.AI

AI总结 研究测试时协作收益不均衡问题,将固定候选池选择器或验证器净收益分解为可测量因素,通过实验表明收益受预言机差距和信号保真度限制,框架可在协作前进行预部署诊断,估计相关指标。

Comments 13 pages, 2 figures, 8 tables. Code: https://github.com/AmGarfield/OracleGap

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11686 2026-07-16 cs.LG cs.AI 版本更新 73%

Representation-Based Exploration for Language Models: From Test-Time to Post-Training

基于表示的语言模型探索:从测试时到训练后

Jens Tuyls, Dylan J. Foster, Akshay Krishnamurthy, Jordan T. Ash

机构 * Princeton University(普林斯顿大学) Microsoft Research(微软研究院)

专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.AI、cs.LG

AI总结 研究语言模型中强化学习探索新行为的价值,提出基于预训练模型隐藏状态的表示奖励探索方法,在推理时和训练后都显著提升了模型性能,如验证效率和测试时样本效率,为发现新行为提供实用途径。

Comments Accepted at ICLR 2026. Website and code: https://rep-exp.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06799 2026-07-09 cs.LG cs.AI 新提交 73%

What Predicts Correctness in Text-to-SQL? A Selective-Prediction Study

什么能预测文本到SQL的正确性?一项选择性预测研究

Robert Richardson

专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.AI、cs.LG

AI总结 研究哪些信号能预测文本到SQL的正确性,黑盒信号AUROC在0.61到0.68之间,基于验证的评判器分数更高,集成可达0.82 AUROC。还探讨验证器训练,微调后的验证器在分布内表现较好,但跨模式泛化能力不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30851 2026-07-01 cs.CL cs.AI cs.DB 新提交 73%

Test-Time Verification for Text-to-SQL via Outcome Reward Models

基于结果奖励模型的文本到SQL测试时验证

Mattia Tritto, Giuseppe Farano, Dario Di Palma, Gaetano Rossiello, Fedelucio Narducci, Dharmashankar Subramanian, Tommaso Di Noia

机构 * Polytechnic University of Bari(巴里理工大学) IBM T.J. Watson Research Center(IBM T.J.沃森研究中心)

专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.CL、cs.AI

AI总结 提出结果奖励模型(ORM)作为学习型语义评分函数,用于Text-to-SQL的测试时验证,通过自动化候选生成和执行标签训练ORM,在BIRD和Spider基准上优于执行优先和多数投票方法。

Comments Accepted to the SURGeLLM Workshop at ACL 2026, San Diego, US

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26300 2026-06-26 cs.AI cs.CL 新提交 73%

The Verification Horizon: No Silver Bullet for Coding Agent Rewards

验证地平线:编码智能体奖励没有银弹

Binghai Wang, Chenlong Zhang, Dayiheng Liu, Jiajun Zhang, Jiawei Chen, Mingze Li, Mouxiang Chen, Rongyao Fang, Siyuan Zhang, Xuwu Wang, Yuheng Jing, Zeyao Ma, Zeyu Cui

机构 * Qwen Team(Qwen团队)

专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.CL、cs.AI

AI总结 本文指出,随着编码智能体能力增强,验证解决方案比生成更难,并沿可扩展性、忠实性和鲁棒性三个维度分析验证信号质量,通过四种奖励构建实验表明验证必须与生成器共同进化。

Comments Authors are listed alphabetically by their first names

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19346 2026-06-23 cs.CL cs.AI 新提交 73%

Disentangling Linguistic Relatedness from Task Alignment in Cross-Lingual Transfer

跨语言迁移中语言相关性与任务对齐的解耦

Ahmed Haj Ahmed, Ruochen Zhang, Alvin Grissom

机构 * Haverford College(哈弗福德学院) Brown University(布朗大学)

专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 通过微调大语言模型并在闪语族与非闪语族语言上评估零样本阅读理解,发现跨语言迁移主要提升任务格式对齐而非语言特定知识。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04815 2026-06-23 cs.LG cs.AI 版本更新 73%

Learning While Acting: A Skill-Enhanced Test-Time Co-Evolution Framework for Online Lifelong Learning Agents

边行动边学习:面向在线终身学习智能体的技能增强测试时协同进化框架

Bo Mao, Jie Zhou, Yutao Yang, Xin Li, Xian Wei, Qin Chen, Xingjiao Wu, Liang He

机构 * School of Computer Science and Technology, East China Normal University(东华大学计算机科学与技术学院) Shanghai AI Laboratory(上海人工智能实验室) Software Engineering Institute, East China Normal University(东华大学软件工程学院)

专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.AI、cs.LG

AI总结 提出LifeSkill框架,通过验证器引导的技能学习和在线技能内化,使LLM智能体在测试时持续内化反馈,提升终身学习性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05625 2026-06-05 cs.AI cs.LG 73%

Self-Commitment Latency: A Reward-Free Probe for Prompted Implicit Hacking

自承诺延迟:一种用于提示隐式劫持的无奖励探针

Bonan Shen, Youting Wang, Dingyan Shang, Tao Ning

机构 * Stanford University(斯坦福大学) Tsinghua University(清华大学)

专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.AI、cs.LG

AI总结 提出自承诺延迟指标,通过测量推理上下文对模型自身最终答案的承诺时机,无需奖励信号即可检测提示隐式劫持,在GSM8K数据集上达到AUROC 0.878-0.926。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03608 2026-06-03 cs.LG cs.AI 73%

Exploiting Verification-Generation Gap: Test-Time Reinforcement Learning with Confidence-Conditioned Verification

利用验证-生成差距:基于置信度条件的测试时强化学习

Jiahui Li, Jianfeng Shan, Wenpei Chen, Shunyu Wu, Jian Lou, Wenjie Feng, Dan Li, See-Kiong Ng

机构 * Sun Yat-Sen University(中山大学) University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学)

专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.AI、cs.LG

AI总结 提出TTRL-CoCoV框架,通过置信度自适应机制解决无标签设置下Pass@k优化中的伪标签错误和多样性崩溃问题,显著提升Pass@1和Pass@k性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22156 2026-05-22 cs.LG cs.AI 73%

One-Way Policy Optimization for Self-Evolving LLMs

单向策略优化用于自演化大语言模型

Shuo Yang, Jinda Lu, Kexin Huang, Chiyu Ma, Shaohang Wei, Yuyang Liu, Guoyin Wang, Jingren Zhou, Li Yuan

机构 * Shenzhen Graduate School, Peking University(北京大学深圳研究生院) Dartmouth College(达特茅斯学院) Alibaba(阿里巴巴)

专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.AI、cs.LG

AI总结 本文提出单向策略优化方法,通过解耦优化方向与更新幅度,解决传统方法中验证器奖励稀疏导致的训练不稳定问题,实现大语言模型的持续自演化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19317 2026-05-20 cs.LG cs.AI 73%

Inference-Time Scaling in Diffusion Models through Iterative Partial Refinement

通过迭代部分细化在扩散模型中实现推理时间扩展

Taegu Kang, Jaesik Yoon, Sungjin Ahn

机构 * KAIST(韩国科学技术院)

专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种无需外部验证器的扩散模型推理时间扩展方法Iterative Partial Refinement,通过在混合噪声条件下迭代部分细化生成更一致的样本,在MNIST Sudoku任务中提升了有效解率。

Comments Accepted at the ICLR 2026 Workshop on AI with Recursive Self-Improvement

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18805 2026-05-20 cs.IR cs.AI cs.LG 73%

RecoAtlas: From Semantic Plausibility to Set-Level Utility in LLM Recommendation Agents

RecoAtlas: 从语义合理性到集级效用在LLM推荐代理中

Imad Aouali, Flavian Vasile, Otmane Sakhi, Alexandre Gilotte, Benjamin Heymann

机构 * Criteo AI Lab(Criteo人工智能实验室)

专题命中 测试时计算 :reasoning(abstract);test-time compute(abstract);分类 cs.AI、cs.LG

AI总结 本文提出RecoAtlas,一个用于评估购物代理的基准和工具包,通过行为基础的度量标准来评估推荐代理的性能,揭示语义合理性并不一定代表行为基础的效用。

Comments Benchmark on LLM Recommendation Agents

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13907 2026-05-15 stat.ML cs.AI cs.LG 73%

AIS: Adaptive Importance Sampling for Quantized RL

AIS: 量化强化学习中的自适应重要性采样

Jiajun Zhou, Wei Shao, Lingchao Zheng, Yuwei Fan, Ngai Wong

机构 * Huawei(华为) The University of Hong Kong(香港大学)

专题命中 测试时计算 :reasoning(abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出AIS方法,通过动态调整重要性采样强度,解决量化强化学习中 rollout 与训练不匹配导致的策略梯度偏差问题,在保持FP8加速优势的同时,提升训练稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11011 2026-05-13 cs.LG cs.AI 73%

LoopUS: Recasting Pretrained LLMs into Looped Latent Refinement Models

LoopUS: 将预训练大语言模型转换为循环潜在细化模型

Taekhyun Park, Yongjae Lee, Dohee Kim, Hyerim Bae

机构 * Department of Data Science(数据科学系) Department of Industrial Engineering(工业工程系) Pusan National University(釜山国立大学) Changwon National University(昌原国立大学)

专题命中 测试时计算 :reasoning(abstract);test-time compute(abstract);分类 cs.AI、cs.LG

AI总结 LoopUS通过循环架构提升LLM推理性能,无需重新训练,采用四个核心组件稳定模型并提高效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17609 2026-04-21 cs.CL cs.LG 73%

Agents Explore but Agents Ignore: LLMs Lack Environmental Curiosity

智能体探索但忽视环境:大语言模型缺乏环境好奇心

Leon Engländer, Sophia Althammer, Ahmet Üstün, Matthias Gallé, Tom Sherborne

机构 * Cohere Poolside

专题命中 测试时计算 :reasoning(abstract);test-time compute(abstract);分类 cs.CL、cs.LG

AI总结 研究发现当前大语言模型缺乏环境好奇心,无法有效利用意外但相关的信息。通过三个基准测试发现,尽管智能体发现了解决方案,但很少主动利用。研究指出可用工具、计算资源和训练数据分布是影响因素,优化配置能提升性能,但智能体仍主要依赖环境获取预期信息。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15149 2026-04-17 cs.LG cs.AI 73%

LLMs Gaming Verifiers: RLVR can Lead to Reward Hacking

Lukas Helff, Quentin Delfosse, David Steinmann, Ruben Härle, Hikaru Shindo, Patrick Schramowski, Wolfgang Stammer, Kristian Kersting, Felix Friedrich

机构 * TU Darmstadt(图宾根大学) DFKI(德累斯顿人工智能研究所) Intrinsic Lab1141(Lab1141实验室) CERTAIN, Germany(德国CERTAIN) MPI-Inf, SIC(慕尼黑人工智能研究所) Meta

专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08369 2026-04-10 cs.AI cs.CL cs.MA 73%

Don't Overthink It: Inter-Rollout Action Agreement as a Free Adaptive-Compute Signal for LLM Agents

不要过度思考:跨回合动作一致性作为LLM代理的自由自适应计算信号

Khushal Sethi

机构 * Stanford University(斯坦福大学)

专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.CL、cs.AI

AI总结 TrACE通过测量跨回合动作一致性,实现LLM代理的自适应计算分配,无需训练或外部验证,在多步序列决策任务中提升效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22025 2026-04-09 cs.AI cs.CL cs.CV 73%

UI-AGILE: Advancing GUI Agents with Effective Reinforcement Learning and Precise Inference-Time Grounding

UI-AGILE: 通过有效的强化学习和精确的推理时间接地提升GUI代理

Shuquan Lian, Yuhang Wu, Jia Ma, Yifan Ding, Zihan Song, Bingqi Chen, Xiawu Zheng, Hui Li, Rongrong Ji

机构 * Sino-Russian Research Center for Digital Economy(中俄数字经济研究中心)

专题命中 测试时计算 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 UI-AGILE通过改进监督微调过程和推理中的分解接地,提升了GUI代理的接地性能和通用能力,在ScreenSpot-Pro和ScreenSpot-v2基准上实现了最佳表现,地面准确率提升23%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.17501 2026-03-27 cs.LG cs.AI 73%

The Limits of Inference Scaling Through Resampling

通过重采样实现推理扩展的极限

Benedikt Stroebl, Sayash Kapoor, Arvind Narayanan

机构 * Princeton University(普林斯顿大学)

专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.AI、cs.LG

AI总结 研究指出,重采样方法在验证器不完美时存在根本限制,无法降低误报率,从而限制了推理扩展的准确性,无论计算资源如何。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12299 2026-03-24 cs.CL cs.AI 73%

MobileIPL: Enhancing Mobile Agents Thinking Process via Iterative Preference Learning

MobileIPL: 通过迭代偏好学习增强移动代理的思维过程

Kun Huang, Weikai Xu, Yuxuan Liu, Quandong Wang, Pengzhi Gao, Wei Liu, Jian Luan, Bin Wang, Bo An

机构 * Xiaomi Inc.(小米公司) Nanyang Technological University(南洋理工大学) Gaoling School of Artificial Intelligence, Renmin University of China(人民大学人工智能学院)

专题命中 测试时计算 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出MobileIPL,通过迭代偏好学习构建CoaT树,结合规则奖励和反馈反向传播,提升移动代理在GUI任务中的推理能力与泛化能力。

Comments 9 pages, 8 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20215 2026-03-24 cs.CL cs.LG 73%

Multi-Agent Debate with Memory Masking

具有记忆掩码的多智能体辩论

Hongduan Tian, Xiao Feng, Ziyuan Zhao, Xiangyu Zhu, Rolan Yan, Bo Han

机构 * TMLR Group, Hong Kong Baptist University(香港 Baptist 大学 TMLR 团队) Search Algorithm Group, WeChat, Tencent(微信搜索算法团队,腾讯)

专题命中 测试时计算 :reasoning(abstract);logical reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出MAD-M$^2$框架,通过在每轮辩论前屏蔽错误记忆以提升多智能体辩论的鲁棒性,实验证明其在数学和逻辑推理任务中表现更优。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15641 2026-03-18 cs.AI cs.LG cs.NE 73%

Form Follows Function: Recursive Stem Model

形式追随功能:递归茎模型

Navid Hakimi

专题命中 测试时计算 :reasoning(abstract);test-time compute(abstract);分类 cs.AI、cs.LG

AI总结 递归茎模型通过改变训练方式,使网络学习稳定且深度无关的转移算子,从而提升训练效率和测试时的推理能力。

Comments 11 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03605 2026-03-03 cs.AI cs.LG stat.ML 73%

Understanding the Role of Training Data in Test-Time Scaling

理解训练数据在测试时扩展中的作用

Adel Javanmard, Baharan Mirzasoleiman, Vahab Mirrokni

机构 * University of Southern California(南加州大学) Google Research(谷歌研究) University of California Los Angeles(加州大学洛杉矶分校)

专题命中 测试时计算 :reasoning(abstract);test-time compute(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了训练数据对测试时扩展性能的影响,发现增加计算量可减少上下文长度并提升模型表现,但若训练数据缺乏必要技能则可能损害性能。

Comments 25 pages, 5 figures, accepted in ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23234 2026-03-02 cs.AI cs.CL 73%

p-less Sampling: A Robust Hyperparameter-Free Approach for LLM Decoding

p-less采样:一种无需超参数的LLM解码方法

Runyan Tan, Shuang Wu, Phillip Howard

专题命中 测试时计算 :reasoning(abstract);logical reasoning(abstract);分类 cs.CL、cs.AI

AI总结 p-less采样是一种无需超参数的LLM解码方法,通过动态截断阈值提高生成质量并减少温度对文本质量的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22871 2026-02-27 cs.CL cs.AI 73%

Test-Time Scaling with Diffusion Language Models via Reward-Guided Stitching

通过奖励引导缝合实现扩散语言模型的测试时扩展

Roy Miles, Aysim Toker, Andreea-Maria Oncescu, Songcen Xu, Jiankang Deng, Ismail Elezi

机构 * Huawei London Research Center(华为伦敦研究中心) MVP Lab(MVP实验室)

专题命中 测试时计算 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.AI

AI总结 通过奖励引导缝合实现扩散语言模型的测试时扩展,提升数学和编程任务的准确率并降低延迟

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19519 2026-02-24 cs.AI cs.LG 73%

Ada-RS: Adaptive Rejection Sampling for Selective Thinking

Ada-RS: 选择性思维的自适应拒绝采样

Yirou Ge, Yixi Li, Alec Chiu, Shivani Shekhar, Zijie Pan, Avinash Thangali, Yun-Shiuan Chuang, Chaitanya Kulkarni, Uma Kona, Linsey Pang, Prakhar Mehrotra

机构 * PayPal AI

专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG

AI总结 Ada-RS通过自适应拒绝采样提升LLMs在延迟敏感场景下的推理效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏