arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-02-20 至 2026-02-20 共收录 4 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 4 篇

2602.17633 2026-02-20 cs.LG cs.AI stat.ML 84%

When to Trust the Cheap Check: Weak and Strong Verification for Reasoning

何时相信廉价检查:弱验证与强验证用于推理

Shayan Kiyani, Sima Noorani, George Pappas, Hamed Hassani

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 测试时计算 :reasoning(title,abstract);verifier(abstract);分类 cs.AI、cs.LG

AI总结 本文提出弱-强验证策略,通过两个阈值结构控制接受和拒绝错误,以提高LLM推理的可靠性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16833 2026-02-20 cs.LG cs.AI 62%

VAM: Verbalized Action Masking for Controllable Exploration in RL Post-Training -- A Chess Case Study

VAM:在RL后训练中可控探索的可言行动屏蔽——国际象棋案例研究

Zhicheng Zhang, Ziyan Wang, Yali Du, Fei Fang

机构 * Carnegie Mellon University(卡内基梅隆大学) King's College London(国王学院伦敦)

专题命中 测试时计算 :verifier(abstract);分类 cs.AI、cs.LG

AI总结 VAM通过可言化动作屏蔽提升LLM后训练强化学习的探索效率,在国际象棋中验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16787 2026-02-20 cs.LG cs.CL 62%

Better Think Thrice: Learning to Reason Causally with Double Counterfactual Consistency

三思而后行:通过双重反事实一致性学习因果推理

Victoria Lin, Xinnuo Xu, Rachel Lawrence, Risa Ueno, Amit Sharma, Javier Gonzalez, Niranjani Prasad

机构 * Carnegie Mellon University(卡内基梅隆大学) Microsoft Research Cambridge(微软研究院剑桥分部) Microsoft Research India(微软研究院印度分部)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出双重反事实一致性方法,用于评估和提升大型语言模型的因果推理能力,无需标注数据,通过因果干预和反事实预测验证模型能力,并在多种任务中提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06275 2026-02-20 cs.CL 57%

RoPE-LIME: RoPE-Space Locality + Sparse-K Sampling for Efficient LLM Attribution

RoPE-LIME: RoPE空间局部性 + 稀疏K采样用于高效的LLM归因

Isaac Picov, Ritesh Goru

机构 * University of Toronto(多伦多大学) DevRev

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

AI总结 RoPE-LIME通过RoPE空间局部性和稀疏K采样,高效实现LLM归因,减少API调用并提升归因信息质量。

详情

展开后加载摘要…

URL PDF HTML 收藏