P2S: Probabilistic Process Supervision for General-Domain Reasoning Question Answering
P2S: 通用领域推理问答中的概率过程监督
专题命中 测试时计算 :reasoning(title,abstract);CoT(abstract);分类 cs.CL
AI总结 P2S通过概率过程监督提升通用领域推理问答性能,利用路径忠实度奖励解决奖励稀疏性问题。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
P2S: 通用领域推理问答中的概率过程监督
专题命中 测试时计算 :reasoning(title,abstract);CoT(abstract);分类 cs.CL
AI总结 P2S通过概率过程监督提升通用领域推理问答性能,利用路径忠实度奖励解决奖励稀疏性问题。
超越加速 -- 利用KV缓存进行采样与推理
机构 * Department of Computer Science and Engineering, The Chinese University of Hong Kong(香港中文大学计算机科学与工程系) ; Huawei Technologies Co., Ltd.(华为技术有限公司)
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出将KV缓存作为轻量级表示用于采样与推理,展示了其在链式嵌入和快速/缓慢思考切换任务中的有效性,显著提升了推理效率。
Comments Accepted by ICLR26
JEPA-Reasoner:将潜在推理与标记生成解耦
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL
AI总结 JEPA-Reasoner通过解耦潜在推理与标记生成,提升模型在复杂推理任务中的准确率和鲁棒性。
辩证管道用于提升大语言模型鲁棒性
机构 * Università degli Studi di Trieste(特里埃斯特大学)
专题命中 测试时计算 :chain-of-thought(abstract);verifier(abstract);分类 cs.CL
AI总结 本文提出一种辩证管道,通过自我对话提升大语言模型的鲁棒性,有效减少幻觉并提高输出质量。
RPO-RAG: 通过关系感知的偏好优化对齐小型LLM以实现知识图谱问答
机构 * Yonsei University(延世大学)
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 RPO-RAG通过关系感知的偏好优化和以答案为中心的提示设计,提升小型LLM在知识图谱问答中的推理能力,实现性能提升。
Comments Accepted at The Web Conference (WWW) 2026