arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 2030 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 2030 篇

2603.14635 2026-03-24 cs.IR cs.AI 79%

Compute Allocation for Reasoning-Intensive Retrieval Agents

为推理密集型检索代理进行计算分配

Sreeja Apparaju, Nilesh Gupta

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI

AI总结 研究通过BRIGHT基准和Gemini 2.5模型家族,探讨推理密集型检索管道中的计算分配,发现重排阶段受益于更强模型和更深候选池,而查询扩展在轻量模型后效果递减。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03773 2026-03-24 cs.LG 79%

Reasoning Cache: Continual Improvement Over Long Horizons via Short-Horizon RL

推理缓存:通过短期限强化学习实现长周期的持续改进

Ian Wu, Yuxiao Qu, Amrith Setlur, Aviral Kumar

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.LG

AI总结 本文提出RC算法,通过利用LLM的响应生成与总结能力差异,实现长周期的持续改进,实验显示其在HMMT 2025任务中性能显著提升。

Comments preprint v2; revised 2026-03-22 (updated IMO-AnswerBench results)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14745 2026-03-17 cs.LG 79%

CAMD: Coverage-Aware Multimodal Decoding for Efficient Reasoning of Multimodal Large Language Models

CAMD:面向多模态大语言模型高效推理的覆盖感知多模态解码

Huijie Guo, Jingyao Wang, Lingyu Si, Jiahuan Zhou, Changwen Zheng, Wenwen Qiang

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.LG

AI总结 本文提出CAMD,通过动态分配计算资源提升多模态大语言模型的推理效率与可靠性,解决解码方法在易例和难例间的计算不匹配问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04948 2026-03-06 cs.LG 79%

$\nabla$-Reasoner: LLM Reasoning via Test-Time Gradient Descent in Latent Space

∇-Reasoner: 通过潜在空间中的测试时间梯度下降进行LLM推理

Peihao Wang, Ruisi Cai, Zhen Wang, Hongyuan Mei, Qiang Liu, Pan Li, Zhangyang Wang

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) UC San Diego(圣地亚哥大学) TTIC Georgia Tech(佐治亚理工学院)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.LG

AI总结 ∇-Reasoner通过潜在空间中的测试时间梯度下降提升LLM推理能力,实现20%以上的准确率提升并减少模型调用次数。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09016 2026-03-06 cs.LG 79%

SPEED-RL: Faster Training of Reasoning Models via Online Curriculum Learning

SPEED-RL: 通过在线课程学习加速推理模型训练

Ruiqi Zhang, Daman Arora, Song Mei, Andrea Zanette

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.LG

AI总结 SPEED-RL通过在线课程学习方法,提升推理模型训练效率,实现2-6倍的加速,同时保持准确性。

Comments There are some bugs in the experiments, and we cannot fix them to make it satisfactory to us

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01143 2026-03-03 cs.CV cs.AI 79%

TC-SSA: Token Compression via Semantic Slot Aggregation for Gigapixel Pathology Reasoning

基于语义槽聚合的token压缩:用于十亿像素病理推理

Zhuo Chen, Shawn Young, Lijian Xu

机构 * Shenzhen University of Advanced Technology(深圳先进技术大学) University of Nottingham NingBo(诺丁汉大学宁波学院)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI

AI总结 TC-SSA通过语义槽聚合实现token压缩,提升十亿像素病理推理的效率与诊断性能

Comments 8 pages, 4 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00381 2026-03-03 cs.CR cs.AI cs.SY eess.SY 79%

Verifier-Bound Communication for LLM Agents: Certified Bounds on Covert Signaling

用于LLM代理的验证器绑定通信:对隐蔽信号的认证界限

Om Tailor

机构 * umd(马里兰大学)

专题命中 测试时计算 :verifier(title,abstract);分类 cs.AI

AI总结 本文提出CLBC协议,通过验证器绑定通信限制LLM代理的隐蔽信号,确保安全性和可验证性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26578 2026-03-02 cs.LG 79%

Linking Process to Outcome: Conditional Reward Modeling for LLM Reasoning

将过程与结果联系起来:用于大语言模型推理的条件奖励建模

Zheng Zhang, Ziwei Shan, Kaitao Song, Yexin Li, Kan Ren

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.LG

AI总结 本文提出条件奖励建模(CRM),通过将LLM推理视为时间过程,解决奖励分配模糊性和奖励黑客问题,提升推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21756 2026-02-26 cs.IR cs.LG 79%

Offline Reasoning for Efficient Recommendation: LLM-Empowered Persona-Profiled Item Indexing

离线推理用于高效推荐:基于LLM的个性化-属性化物品索引

Deogyong Kim, Junseong Lee, Jeongeun Lee, Changhoe Kim, Junguel Lee, Jungseok Lee, Dongha Lee

机构 * Yonsei University(延世大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.LG

AI总结 Persona4Rec通过离线推理构建物品个性化表示,实现高效且可解释的推荐系统,减少推理时间并提供直观解释。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21317 2026-02-26 cs.LG 79%

Shared Nature, Unique Nurture: PRISM for Pluralistic Reasoning via In-context Structure Modeling

共享本质,独特培养:通过上下文结构建模实现多元推理的PRISM

Guancheng Tu, Shiyang Zhang, Tianyu Zhang, Yi Zhang, Diji Yang

机构 * University of Pennsylvania(宾夕法尼亚大学) Yale University(耶鲁大学) University of California Santa Cruz(加州大学圣克鲁兹分校)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.LG

AI总结 PRISM通过上下文结构建模实现多元推理,提升创造力和科学发现能力,展现独特认知轨迹的多元AI新范式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15937 2026-02-24 cs.AI 79%

Advancing Mobile GUI Agents: A Verifier-Driven Approach to Practical Deployment

推进移动GUI代理:一种以验证器驱动的方法用于实际部署

Gaole Dai, Shiqi Jiang, Ting Cao, Yuanchun Li, Yuqing Yang, Rui Tan, Mo Li, Lili Qiu

机构 * Nanyang Technological University(南洋理工大学) Microsoft Research(微软研究院) Tsinghua University(清华大学)

专题命中 测试时计算 :verifier(title,abstract);分类 cs.AI

AI总结 V-Droid通过验证器驱动的方法提升移动GUI任务自动化代理的性能与效率

Comments "V-Droid: Advancing Mobile GUI Agent Through Generative Verifiers", got accepted to MobiCom 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14428 2026-02-17 cs.CL 79%

LLM-Guided Knowledge Distillation for Temporal Knowledge Graph Reasoning

基于大语言模型的知识蒸馏的时序知识图谱推理

Wang Xing, Wei Song, Siyu Lin, Chen Wu, Man Wang

机构 * School of Computer Science and Technology, Xidian University(西安电子科技大学计算机科学与技术学院) School of Computing and Artificial Intelligence, Southwest Jiaotong University(西南交通大学计算机与人工智能学院) School of Information Science and Engineering, Chongqing Jiaotong University(重庆交通大学信息科学与工程学院)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出一种基于大语言模型的知识蒸馏框架,用于提升时序知识图谱推理性能,通过引入大语言模型作为辅助指导者,实现更高效的模型压缩与训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00760 2026-02-10 cs.CL 79%

APR: Penalizing Structural Redundancy in Large Reasoning Models via Anchor-based Process Rewards

APR:通过基于锚点的过程奖励惩罚大型推理模型中的结构冗余

Kaiyan Chang, Chenwei Zhu, Yingfeng Luo, Yifu Huo, Chenglong Wang, Xiaoqian Liu, Qiaozhi He, Tong Xiao, Zhengtao Yu, Jingbo Zhu

机构 * NiuTrans Research(尼utoff研究)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL

AI总结 APR通过基于锚点的过程奖励方法,有效惩罚大型推理模型中的结构冗余,提升推理效率与性能。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04742 2026-02-05 cs.CY cs.CL 79%

Inference-Time Reasoning Selectively Reduces Implicit Social Bias in Large Language Models

推理时的推理选择性减少大语言模型中的隐性社会偏见

Molly Apsel, Michael N. Jones

机构 * Cognitive Science Program Department of Psychological & Brain Sciences Indiana University Bloomington(心理与脑科学系认知科学计划印第安纳大学布卢明顿)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL

AI总结 该研究通过推理增强减少大语言模型中的隐性社会偏见,揭示推理对公平性评估的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04254 2026-02-05 cs.CL 79%

Scaling Agentic Verifier for Competitive Coding

为竞争编程设计的扩展代理验证器

Zeyao Ma, Jing Zhang, Xiaokang Zhang, Jiaxi Yang, Zongmeng Zhang, Jiajun Zhang, Yuheng Jing, Lei Zhang, Hao Zheng, Wenting Zhao, Junyang Lin, Binyuan Hui

机构 * Renmin University of China(中国人民大学) Qwen Team, Alibaba Group(通义实验室,阿里巴巴集团)

专题命中 测试时计算 :verifier(title,abstract);分类 cs.CL

AI总结 本文提出Agentic Verifier,通过主动推理和高效测试输入生成,提升竞争编程问题解决的准确性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01791 2026-02-03 cs.LG 79%

Grad2Reward: From Sparse Judgment to Dense Rewards for Improving Open-Ended LLM Reasoning

Grad2Reward: 从稀疏判断到密集奖励以提升开放性大语言模型推理

Zheng Zhang, Ao Lu, Yuanhao Zeng, Ziwei Shan, Jinjin Guo, Lufei Li, Yexin Li, Kan Ren

机构 * School of Information Science and Technology, ShanghaiTech University(信息科学与技术学院,上海科技大学) State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.LG

AI总结 Grad2Reward通过从判断者模型推理过程中提取密集过程奖励,提升开放性大语言模型推理的效率和质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00154 2026-02-03 cs.CR cs.AI 79%

ReasoningBomb: A Stealthy Denial-of-Service Attack by Inducing Pathologically Long Reasoning in Large Reasoning Models

ReasoningBomb: 通过诱导病态长推理实现隐蔽的拒绝服务攻击

Xiaogeng Liu, Xinyan Wang, Yechao Zhang, Sanjay Kariyappa, Chong Xiang, Muhao Chen, G. Edward Suh, Chaowei Xiao

机构 * Johns Hopkins University(约翰霍普金斯大学) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Nanyang Technological University(南洋理工大学) NVIDIA(NVIDIA公司) University of California, Davis(加州大学戴维斯分校) Cornell University(康奈尔大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI

AI总结 ReasoningBomb通过生成短自然提示诱导大型推理模型进入病态长推理,实现隐蔽的拒绝服务攻击,具有高放大率、隐蔽性和可优化性。

Comments Pre-print. Code is available at https://github.com/SaFo-Lab/ReasoningBomb

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00127 2026-02-03 cs.LG 79%

ALIGN: Aligned Delegation with Performance Guarantees for Multi-Agent LLM Reasoning

ALIGN: 多智能体LLM推理中的对齐委托与性能保证

Tong Zhu, Baiting Chen, Jin Zhou, Hua Zhou, Sriram Sankararaman, Xiaowu Dai

机构 * Department of Biostatistics, UCLA(生物统计学系,加州大学洛杉矶分校) Department of Statistics and Data Science, UCLA(统计学与数据科学系,加州大学洛杉矶分校) Department of Computer Science, UCLA(计算机科学系,加州大学洛杉矶分校) Departments of Statistics and Data Science, and of Biostatistics, UCLA(统计学与数据科学系和生物统计学系,加州大学洛杉矶分校)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.LG

AI总结 ALIGN通过多智能体对齐委托机制,提升大语言模型在复杂推理任务中的性能保障与表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19171 2026-01-29 cs.CL 79%

JEPA-Reasoner: Decoupling Latent Reasoning from Token Generation

JEPA-Reasoner:将潜在推理与标记生成解耦

Bingyang Kelvin Liu, Ziyu Patrick Chen, David P. Woodruff

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Carnegie Mellon University(卡内基梅隆大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL

AI总结 JEPA-Reasoner通过解耦潜在推理与标记生成,提升模型在复杂推理任务中的准确率和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19847 2026-01-28 cs.CL 79%

Identifying and Transferring Reasoning-Critical Neurons: Improving LLM Inference Reliability via Activation Steering

识别并转移推理关键神经元:通过激活引导提升LLM推理可靠性

Fangan Dong, Zuming Yan, Xuri Ge, Zhiwei Xu, Mengqi Zhang, Xuanang Chen, Ben He, Xin Xin, Zhumin Chen, Ying Zhou

机构 * Shandong University(山东大学) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出AdaRAS,通过识别并引导推理关键神经元提升LLM推理可靠性,实验显示在数学和编程基准测试中取得显著改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14140 2026-01-28 cs.AI 79%

RL of Thoughts: Navigating LLM Reasoning with Inference-time Reinforcement Learning

思维强化学习:通过推理时间强化学习导航大语言模型推理

Qianyue Hao, Sibo Li, Jian Yuan, Yong Li

机构 * Department of Electronic Engineering, BNRist, Tsinghua University(电子工程系、BNRist、清华大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI

AI总结 RL-of-Thoughts通过强化学习训练轻量级导航模型,提升大语言模型推理能力,实现多任务适应性和参数高效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02846 2026-01-26 cs.LG physics.comp-ph 79%

Towards Reasoning for PDE Foundation Models: A Reward-Model-Driven Inference-Time-Scaling Algorithm

面向PDE基础模型的推理:一种基于奖励模型的推理时扩展算法

Siddharth Mansingh, James Amarel, Ragib Arnab, Arvind Mohan, Kamaljeet Singh, Gerd J. Kunde, Nicolas Hengartner, Benjamin Migliori, Emily Casleton, Nathan A. Debardeleben, Ayan Biswas, Diane Oyen, Earl Lawrence

机构 * Los Alamos National Laboratory(洛斯阿拉莫斯国家实验室)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.LG

AI总结 本文提出了一种基于奖励模型的推理时扩展算法,用于提升PDE基础模型在分布外情况下的预测准确性,减少对训练样本和模型规模的依赖。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06423 2026-01-13 cs.AI 79%

Does Inference Scaling Improve Reasoning Faithfulness? A Multi-Model Analysis of Self-Consistency Tradeoffs

推理扩展是否能提升推理的可靠性?对多模型自一致性权衡的分析

Deep Mehta

机构 * Adobe Inc(Adobe公司)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI

AI总结 研究探讨推理扩展对推理可靠性的影响,发现不同模型表现各异,自一致性并非普遍有效,需根据具体模型进行测试。

Comments 24 pages, 3 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03605 2026-01-08 cs.CL 79%

DiVA: Fine-grained Factuality Verification with Agentic-Discriminative Verifier

DiVA: 基于代理-判别验证器的细粒度事实性验证

Hui Huang, Muyun Yang, Yuki Arase

机构 * Harbin Institute of Technology(哈尔滨工业大学) Institute of Science Tokyo(东京科学研究所)

专题命中 测试时计算 :verifier(title,abstract);分类 cs.CL

AI总结 DiVA通过结合生成模型和判别模型的能力,提出了一种细粒度事实性验证方法,并构建了FGVeriBench基准,有效提升了事实性验证的精度和适用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12492 2025-12-17 cs.CV cs.CL 79%

Adaptive Detector-Verifier Framework for Zero-Shot Polyp Detection in Open-World Settings

面向开放世界设置的零样本息肉检测自适应检测-验证框架

Shengkai Xu, Hsiang Lun Kao, Tianxiang Xu, Honghui Zhang, Junqiao Wang, Runmeng Ding, Guanyu Liu, Tianyu Shi, Zhenyu Yu, Guofeng Pan, Ziqian Bi, Yuqi Ouyang

机构 * College of Computer Science, Sichuan University(四川大学计算机学院) Columbia University(哥伦比亚大学) School of Software and Microelectronics, Peking University(北京大学软件与微电子学院) Apon AI and Brain-Computer Engineering Research Institute(Apon人工智能与脑机工程研究院) Faculty of Science and Technology, University of Macau(澳门大学科学与技术学院) Faculty of Applied Science and Engineering, University of Toronto(多伦多大学应用科学与工程学院) Faculty of Computer Science and Information Technology, University of Malaya(马来亚大学计算机科学与信息技术学院) Zhaolong Technology(智龙科技) Purdue University(普渡大学)

专题命中 测试时计算 :verifier(title,abstract);分类 cs.CL

AI总结 本文提出AdaptiveDetector,通过自适应阈值调整和成本敏感强化学习,实现开放世界中零样本息肉检测,提升召回率并减少假阴性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12967 2025-12-16 cs.CL 79%

QwenLong-L1.5: Post-Training Recipe for Long-Context Reasoning and Memory Management

QwenLong-L1.5: 长上下文推理与内存管理的训练配方

Weizhou Shen, Ziyi Yang, Chenliang Li, Zhiyuan Lu, Miao Peng, Huashan Sun, Yingcheng Shi, Shengyi Liao, Shaopeng Lai, Bo Zhang, Dayiheng Liu, Fei Huang, Jingren Zhou, Ming Yan

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL

AI总结 QwenLong-L1.5通过长上下文数据合成、稳定强化学习和内存增强架构,提升长上下文推理能力及超长任务处理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04558 2025-12-05 cs.LG 79%

On the Limits of Test-Time Compute: Sequential Reward Filtering for Better Inference

在测试时间计算的极限:用于更好推理的顺序奖励过滤

Yue Yu, Qiwei Di, Quanquan Gu, Dongruo Zhou

专题命中 测试时计算 :test-time compute(title,abstract);分类 cs.LG

AI总结 本文提出顺序奖励过滤方法,通过选择高奖励生成物优化测试时间计算,提升大语言模型的推理性能。

Comments 45 pages, 6 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02217 2025-12-03 cs.LG physics.app-ph 79%

Uncertainty Reasoning with Photonic Bayesian Machines

基于光子贝叶斯机器的不确定性推理

F. Brückerhoff-Plückelmann, H. Borras, S. U. Hulyal, L. Meyer, X. Ji, J. Hu, J. Sun, B. Klein, F. Ebert, J. Dijkstra, L. McRae, P. Schmidt, T. J. Kippenberg, H. Fröning, W. Pernice

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.LG

AI总结 本研究提出一种基于光子技术的贝叶斯机器,利用混沌光源实现高速不确定性推理,应用于血细胞图像分类与域外检测,提升可信AI系统的效率与可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02008 2025-12-02 cs.CL 79%

The Art of Scaling Test-Time Compute for Large Language Models

为大语言模型扩展推理时的计算艺术

Aradhye Agarwal, Ayan Sengupta, Tanmoy Chakraborty

机构 * Microsoft Research(微软研究院) Indian Institute of Technology Delhi(印度德里理工学院)

专题命中 测试时计算 :test-time compute(title);reasoning(abstract);分类 cs.CL

AI总结 本文研究了大语言模型推理时计算扩展策略的优化,发现不同模型类型和问题难度对性能有显著影响,并提出了基于计算预算的选择策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23262 2025-12-01 cs.AI 79%

Adapting Like Humans: A Metacognitive Agent with Test-time Reasoning

像人类一样适应:具有测试时推理的元认知代理

Yang Li, Zhiyuan He, Yuxuan Huang, Zhuhanling Xiao, Chao Yu, Meng Fang, Kun Shao, Jun Wang

机构 * Huawei Noah’s Ark Lab(华为诺亚实验室) University of Oxford(牛津大学) Tsinghua University(清华大学) University of Liverpool(利物浦大学) University College London(伦敦大学学院)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出元认知测试时推理框架,通过元认知自我更新实现模型在测试时的高效适应,实验表明其在Atari游戏中表现出优于基线的适应能力。

详情

展开后加载摘要…

URL PDF HTML 收藏