arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-02-13 至 2026-02-13 共收录 2 信号源:cs.CL, cs.AI, cs.LG

1. 代码与定理证明 2 篇

2602.12170 2026-02-13 cs.AI 70%

Statistical Parsing for Logical Information Retrieval

逻辑信息检索的统计解析

Greg Coppola

机构 * Greg Coppola, PhD(格雷格·科波拉,博士)

专题命中 代码与定理证明 :reasoning(abstract);verifier(abstract);分类 cs.AI

AI总结 本文提出了一种结合LLM和QBBN的逻辑信息检索方法,通过扩展QBBN实现反向推理,构建类型逻辑语言和确定性语法解析器,以提升自然语言处理的结构化解析能力。

Comments 23 pages, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06111 2026-02-13 cs.AI 57%

SKATE, a Scalable Tournament Eval: Weaker LLMs differentiate between stronger ones using verifiable challenges

SKATE,一种可扩展的锦标赛评估:较弱的LLM通过可验证的挑战区分更强的LLM

Dewi S. W. Gould, Bruno Mlodozeniec, Samuel F. Brown

机构 * The Alan Turing Institute(阿尔文·图灵研究所) University of Cambridge(剑桥大学) Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) Independent(独立研究者)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 SKATE通过让LLM相互生成和解决可验证任务,实现可扩展的评估框架,揭示模型间的细微能力差异。

Comments 7 pages and appendices

详情

展开后加载摘要…

URL PDF HTML 收藏