arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-02-12 至 2026-02-12 共收录 5 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 5 篇

2602.10885 2026-02-12 cs.AI cs.LG 90%

Reinforcing Chain-of-Thought Reasoning with Self-Evolving Rubrics

通过自演化评分标准强化链式推理

Leheng Sheng, Wenchang Ma, Ruixin Hong, Xiang Wang, An Zhang, Tat-Seng Chua

机构 * National University of Singapore(新加坡国立大学)

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract);分类 cs.AI、cs.LG

AI总结 RLCER通过自演化评分标准提升链式推理的奖励机制,无需人工标注即可实现更高效的推理性能。

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09555 2026-02-12 cs.CL 70%

Advancing Block Diffusion Language Models for Test-Time Scaling

推进块扩散语言模型用于测试时间扩展

Yi Lu, Deyang Kong, Jianing Wang, Linsen Guo, Xue Wang, Qi Guo, Tao Gui, Xuanjing Huang, Wei Ye, Shikun Zhang, Wei Wang

机构 * Fudan University(复旦大学) Peking University(北京大学)

专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 本文提出BACD和TCCF方法,提升块扩散语言模型在测试时间扩展中的推理效率和效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10329 2026-02-12 cs.CL cs.AI cs.LG 67%

Are More Tokens Rational? Inference-Time Scaling in Language Models as Adaptive Resource Rationality

更多令牌是否理性?语言模型推理时的扩展作为适应性资源理性

Zhimin Hu, Riya Roshan, Sashank Varma

机构 * Georgia Tech(佐治亚理工学院)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究通过变量归因任务探讨语言模型在推理时扩展对资源理性的影响,发现模型能根据任务复杂性调整策略,即使无显式成本奖励。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05188 2026-02-12 cs.CL cs.AI 62%

Fixing the Broken Compass: Diagnosing and Improving Inference-Time Reward Modeling

修复破碎的指南针:诊断并改进推理时间奖励建模

Jiachun Li, Pengfei Cao, Zhuoran Jin, Yubo Chen, Jiexin Xu, Huaijun Li, Xiaojian Jiang, Kang Liu, Jun Zhao

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) The Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所认知与决策智能复杂系统重点实验室) China Merchants Bank(中国 Merchants 银行)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出CRISP算法,通过聚类和逐步前缀优化,提升LLM在推理任务中的性能,实现5%的准确率提升。

Comments 38 pages, 30 figures, Accpeted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10522 2026-02-12 cs.SE 50%

Consistency Meets Verification: Enhancing Test Generation Quality in Large Language Models Without Ground-Truth Solutions

一致性与验证:在没有真实解决方案的情况下提升大型语言模型的测试生成质量

Hamed Taherkhani, Alireza DaghighFarsoodeh, Mohammad Chowdhury, Hung Viet Pham, Hadi Hemmati

专题命中 测试时计算 :reasoning(abstract)

AI总结 ConVerTest通过自我一致性、验证链和双执行协议,在无需真实解决方案的情况下提升大型语言模型的测试生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏