arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-01-21 至 2026-01-21 共收录 10 信号源:cs.CL, cs.AI, cs.LG

1. 代码与定理证明 10 篇

2601.13392 2026-01-21 cs.CL cs.AI cs.FL 84%

Beyond Memorization: Testing LLM Reasoning on Unseen Theory of Computation Tasks

超越记忆:在未见的计算理论任务上测试LLM推理能力

Shlok Shelat, Jay Raval, Souvik Roy, Manas Gaur

机构 * Ahmedabad University Gujarat, India(古吉拉特邦阿赫迈德亚布大学) University of Maryland Baltimore County(马里兰大学巴尔的摩县分校)

专题命中 代码与定理证明 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 本文通过构建DFA基准测试,揭示LLM在未见计算理论任务上的推理缺陷,发现其在处理复杂约束和语义一致性时存在系统性不足。

Comments 30 pages, 11 figures, 6 tables, Work in Progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14027 2026-01-21 cs.AI 79%

Numina-Lean-Agent: An Open and General Agentic Reasoning System for Formal Mathematics

Numina-Lean-Agent: 一种面向形式数学的开放且通用的代理推理系统

Junqi Liu, Zihao Zhou, Zekai Zhu, Marco Dos Santos, Weikun He, Jiawei Liu, Ran Wang, Yunzhou Xie, Junqiao Zhao, Qiufeng Wang, Lihong Zhi, Jia Li, Wenda Li

机构 * Academy of Mathematics and Systems Science, University of Chinese Academy of Sciences(中国科学院数学与系统科学研究院) Tongji University(同济大学) University of Cambridge(剑桥大学) Imperial College London(伦敦帝国学院) University of Edinburgh(爱丁堡大学) University of Liverpool(利物浦大学) Xi'an Jiaotong-Liverpool University(西安交通大学利物浦大学)

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.AI

AI总结 Numina-Lean-Agent通过通用编码代理实现形式数学推理,解决Putnam 2025全部问题并成功形式化Brascamp-Lieb定理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08710 2026-01-21 cs.CL 79%

Thinking Longer, Not Always Smarter: Evaluating LLM Capabilities in Hierarchical Legal Reasoning

深入思考,而非总是更聪明:评估大语言模型在分层法律推理中的能力

Li Zhang, Matthias Grabmair, Morgan Gray, Kevin Ashley

机构 * University of Pittsburgh(匹兹堡大学) Technical University of Munich(慕尼黑技术大学)

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出一个框架评估大语言模型在分层法律推理中的能力,发现模型在表面推理准确但分层推理表现下降,揭示了模型在复杂领域中的局限性。

Comments 15 pages, 7 figures, Proceedings of the 2026 Symposium on Computer Science and Law (CSLAW '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05269 2026-01-21 cs.SE cs.AI 79%

CoRe: Benchmarking LLMs Code Reasoning Capabilities through Static Analysis Tasks

CoRe:通过静态分析任务基准测试LLM的代码推理能力

Danning Xie, Mingwei Zheng, Xuwei Liu, Jiannan Wang, Chengpeng Wang, Lin Tan, Xiangyu Zhang

机构 * Department of Computer Science Purdue University(计算机科学系 帕克森大学)

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.AI

AI总结 CoRe通过静态分析任务评估LLM的代码推理能力,发现主流模型在深层次语义理解和多步骤推理上存在不足。

Comments NeurIPS 2025 Datasets & Benchmarks Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11622 2026-01-21 cs.AI cs.LG 62%

Dynamical Systems Analysis Reveals Functional Regimes in Large Language Models

动力系统分析揭示大语言模型中的功能模式

Hassan Ugail, Newton Howard

机构 * Centre for Visual Computing and Intelligent Systems(视觉计算与智能系统中心) University of Bradford(布拉德福德大学) School of Individualised Study(个性化学习学院) Rochester Institute of Technology(罗切斯特技术学院)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文通过动力系统分析揭示大语言模型在不同功能模式中的计算组织差异,提出一种基于时间序列的动态度量指标,用于评估模型内部动态特性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10077 2026-01-21 cs.NE cs.AI cs.DS cs.LG 62%

Predictive Spike Timing Enables Distributed Shortest Path Computation in Spiking Neural Networks

预测性脉冲时间使分布式最短路径计算在脉冲神经网络中成为可能

Simen Storesund, Kristian Valset Aars, Robin Dietrich, Nicolai Waniek

机构 * Department of Mathematical Sciences(数学科学系) Norwegian University of Science and Technology(挪威科学与技术大学) School of Computation, Information and Technology(计算、信息与技术学院) Technical University Munich(慕尼黑技术大学)

专题命中 代码与定理证明 :planning(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出了一种基于生物合理机制的最短路径计算算法,利用脉冲时间巧合实现分布式计算,为生物和人工系统中的复杂问题解决提供新思路。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12444 2026-01-21 cs.AI cs.LO 57%

Large Language Model for OWL Proofs

面向OWL证明的大型语言模型

Hui Yang, Jiaoyan Chen, Uli Sattler

机构 * The University of Manchester(曼彻斯特大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 本文提出面向OWL本体论证明生成的LLM方法,通过构建评估框架验证了逻辑复杂性对LLM性能的影响,并发现输入数据质量对证明生成至关重要。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11825 2026-01-21 cs.AI cs.IR 57%

AI Co-Scientist for Knowledge Synthesis in Medical Contexts: A Proof of Concept

医疗领域知识综合的AI合作者:概念验证

Arya Rahgozar, Pouria Mortezaagha

机构 * Methodological Implementation Research, Ottawa Hospital Research Institute(方法实施研究,渥太华医院研究所) School of Engineering Design and Teaching Innovation, University of Ottawa(工程设计与教学创新学院,渥太华大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 本研究提出了一种基于PICOS的AI合作者,通过整合知识图谱和自然语言处理技术,提升医疗领域证据综合的可扩展性、透明性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17925 2026-01-21 cs.AI 57%

LeanProgress: Guiding Search for Neural Theorem Proving via Proof Progress Prediction

LeanProgress: 通过证明进度预测引导神经定理证明的搜索

Robert Joseph George, Suozhi Huang, Peiyang Song, Anima Anandkumar

机构 * Computing + Mathematical Sciences Department(计算与数学科学系) California Institute of Technology(加利福尼亚理工学院) Computer Science Department(计算机科学系) Princeton University(普林斯顿大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 LeanProgress通过预测证明进度提升神经定理证明效率,实现Mathlib4证明效率提升3.8%

Comments Published in TMLR (Transactions on Machine Learning Research)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12845 2026-01-21 cs.SE 50%

Automatic Generation of Formal Specification and Verification Annotations Using LLMs and Test Oracles

利用LLMs和测试或acles自动生成形式规范和验证注解

João Pascoal Faria, Emanuel Trigo, Vinicius Honorato, Rui Abreu

专题命中 代码与定理证明 :verifier(abstract)

AI总结 本文利用LLMs和测试或acles自动为Dafny程序生成形式规范和验证注解,实验表明该方法在多数情况下有效,并展示了IDE集成的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏