arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-01-29 至 2026-01-29 共收录 5 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 5 篇

2601.20649 2026-01-29 cs.CL 83%

P2S: Probabilistic Process Supervision for General-Domain Reasoning Question Answering

P2S: 通用领域推理问答中的概率过程监督

Wenlin Zhong, Chengyuan Liu, Yiquan Wu, Bovin Tan, Changlong Sun, Yi Wang, Xiaozhong Liu, Kun Kuang

专题命中 测试时计算 :reasoning(title,abstract);CoT(abstract);分类 cs.CL

AI总结 P2S通过概率过程监督提升通用领域推理问答性能,利用路径忠实度奖励解决奖励稀疏性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20326 2026-01-29 cs.CL cs.AI cs.LG 82%

Beyond Speedup -- Utilizing KV Cache for Sampling and Reasoning

超越加速 -- 利用KV缓存进行采样与推理

Zeyu Xing, Xing Li, Hui-Ling Zhen, Mingxuan Yuan, Sinno Jialin Pan

机构 * Department of Computer Science and Engineering, The Chinese University of Hong Kong(香港中文大学计算机科学与工程系) Huawei Technologies Co., Ltd.(华为技术有限公司)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出将KV缓存作为轻量级表示用于采样与推理,展示了其在链式嵌入和快速/缓慢思考切换任务中的有效性,显著提升了推理效率。

Comments Accepted by ICLR26

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19171 2026-01-29 cs.CL 79%

JEPA-Reasoner: Decoupling Latent Reasoning from Token Generation

JEPA-Reasoner:将潜在推理与标记生成解耦

Bingyang Kelvin Liu, Ziyu Patrick Chen, David P. Woodruff

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Carnegie Mellon University(卡内基梅隆大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL

AI总结 JEPA-Reasoner通过解耦潜在推理与标记生成,提升模型在复杂推理任务中的准确率和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20659 2026-01-29 cs.CL cs.MA 70%

A Dialectic Pipeline for Improving LLM Robustness

辩证管道用于提升大语言模型鲁棒性

Sara Candussio

机构 * Università degli Studi di Trieste(特里埃斯特大学)

专题命中 测试时计算 :chain-of-thought(abstract);verifier(abstract);分类 cs.CL

AI总结 本文提出一种辩证管道,通过自我对话提升大语言模型的鲁棒性,有效减少幻觉并提高输出质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19225 2026-01-29 cs.CL cs.AI 62%

RPO-RAG: Aligning Small LLMs with Relation-aware Preference Optimization for Knowledge Graph Question Answering

RPO-RAG: 通过关系感知的偏好优化对齐小型LLM以实现知识图谱问答

Kaehyun Um, KyuHwan Yeom, Haerim Yang, Minyoung Choi, Hyeongjun Yang, Kyong-Ho Lee

机构 * Yonsei University(延世大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 RPO-RAG通过关系感知的偏好优化和以答案为中心的提示设计,提升小型LLM在知识图谱问答中的推理能力,实现性能提升。

Comments Accepted at The Web Conference (WWW) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏