arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-08-28 至 2026-08-28 共收录 10 信号源:cs.CL, cs.AI, cs.LG

1. 代码与定理证明 10 篇

2608.26602 2026-08-28 cs.SE cs.CL 新提交 74%

The Thousand-Graph Hypothesis: A Testable Hypothesis of Task-Conditioned Relation Materialization in Repository-Level Code Reasoning

千图假说:仓库级代码推理中任务条件关系实例化的可检验假说

Fei Ding

专题命中 代码与定理证明 :reasoning(title);分类 cs.CL

AI总结 针对仓库级代码推理的上下文限制与关系图维护问题,该研究提出带任务条件关系实例化的仅实体外部接口,经DeepSeek-V4-Flash和SWE-bench Verified评估,双层索引方案在零预构建边时成功率达95.6%。

Comments 9 pages, 2 figures,

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15740 2026-08-28 cs.FL cs.AI cs.SE 版本更新 70%

HybridProver: Augmenting Theorem Proving with LLM-Driven Proof Synthesis and Refinement

HybridProver:结合大语言模型驱动的证明合成与精化增强定理证明

Jilin Hu, Jianyu Zhang, Yongwang Zhao, Talia Ringer

机构 * College of Computer Science and Technology Zhejiang University(浙江大学计算机科学与技术学院) Siebel Center for Computer Science University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校计算机科学中心)

专题命中 代码与定理证明 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本研究提出HybridProver框架,以证明草图为中间表示集成两种定理证明范式,在miniF2F Isabelle基准上使7B模型成功率达73.8%,优于此前最优水平。

Comments Accepted to EMNLP Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26187 2026-08-28 cs.CL cs.AI cs.LG cs.LO 新提交 67%

When the Canonical Completion Is Wrong: Formalizing and Measuring the Jump in Large Language Models

当规范补全出错时:大型语言模型中跃迁的形式化与测量

Dai Shi, Xiaoyu Li, José Miguel Hernández-Lobato

机构 * University of Cambridge(剑桥大学) University of New South Wales(新南威尔士大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文针对大型语言模型的“跃迁”进行形式化定义与测量,发现模型在第二步会放弃默认补全完成跃迁,更高难度失败源于推理预算或约束问题,而非回归默认,为相关争论提供了新依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26176 2026-08-28 cs.AI cs.CL 新提交 62%

Knowledge Cards: Structured Knowledge for AI Systems

知识卡片:面向AI系统的结构化知识

Liliana Ferreira

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文针对现有AI文档制品未覆盖输入输出间知识层的问题,提出可捕获概念相关结构化知识的Knowledge Card,已在能源等领域构建原型并发布公共草案。

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26310 2026-08-28 cs.AI 新提交 57%

FaithSieve: Fine-Grained Evaluation of Math Proofs with Faithful Formal Evidence

FaithSieve:基于忠实形式证据的数学证明细粒度评估

Ziyu Wang, Qiming Dai, Yishan Wu, Zaiwen Wen

机构 * Peking University(北京大学) School of Mathematical Sciences(数学科学学院) Huawei Technologies Co., Ltd.(华为技术有限公司)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 本研究提出Lean辅助框架FaithSieve,通过分解数学证明为细粒度单元并结合忠实形式证据,在两个专家验证数据集上提升了首个错误定位的精确评估准确率。

Comments 32 pages, 3 figures; preprint with appendix and supplementary experimental details

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26291 2026-08-28 cs.AI q-bio.NC 新提交 57%

Assessing mentalization in humans and large language models

评估人类与大型语言模型的心智化能力

Aamir Sohail, Xintong Zhong, Arkady Konovalov, Patricia L. Lockwood, Lei Zhang

机构 * University of Birmingham(伯明翰大学) Virginia Tech(弗吉尼亚理工大学) University of Oxford(牛津大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 本研究以两项经济博弈结合认知计算建模,对比测试DeepSeek等四款LLM智能体与人类参与者,发现不同LLM心智化能力有差异,GPT-5表现优于人类,证实认知计算建模可用于评估人机比较智能。

Comments 46 pages, 4 figures, 2 tables. Supplementary information available on request from the authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26160 2026-08-28 cs.AI 新提交 57%

SAREF-based Ontology for Distributed AI Workflows across the Edge-Fog-Cloud Continuum

面向边-雾-云连续体的基于SAREF的分布式AI工作流本体

Viorica Rozina Chifu, Tudor Cioara, Vasile Ofrim, Liana Toderean, Ionut Anghel, Laura Daniele, Cornelis Bouter

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 本文提出一种符合SAREF的本体,扩展SAREF4SYST本体加入AI相关概念,经智能电网场景验证,可实现边-雾-云环境下分布式AI工作流的语义互操作,部署成功率90%-100%,平均编排决策时间低于80ms。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07167 2026-08-28 cs.AI 版本更新 57%

NiyamAI - An Intent-Bound AI Agent with Cryptographically Verifiable Guardrails using Zero-Knowledge Proofs

NiyamAI——一种使用零知识证明实现密码学可验证护栏的意图绑定AI智能体

Aditya Katkar, Om Karkele, Kartik Mandhane, Manisha More, Yash Kashid

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 Niyam-AI是一种基于零知识证明的意图绑定AI智能体框架,通过SHA-256承诺意图合约、Judge模型验证和zk-SNARK确保证明,在Agent-SafetyBench评估中较多款基线护栏实现显著安全性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16978 2026-08-28 cs.MA 版本更新 56%

Lark: Biologically Inspired Neuroevolution for Multi-Stakeholder LLM Agents

Lark:生物启发的多利益相关者大语言模型代理神经进化

Rikhil Tanugula, Dheeraj Chintapalli, Sunkalp Chandra

专题命中 代码与定理证明 :reasoning(abstract,comments)

AI总结 Lark通过结合大语言模型推理与进化型多智能体系统,解决冗余与利益相关者权衡问题,采用四机制提升策略生成效率与透明度,实验显示其在30轮评估中表现优异且成本可控。

Comments 39th Conference on Neural Information Processing Systems (NeurIPS 2025) Workshop: NeurIPS 2025 Workshop on Efficient Reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26108 2026-08-28 cs.SE 新提交 50%

Agentic AI Containment Architecture for Security Hardening

用于安全加固的智能体AI containment架构

Mohamed ElBendary

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 针对多智能体AI系统的安全风险,本文提出Agent Containment架构,通过六项约束实施「提议-验证-行动-验证」模型,可防御多种威胁,案例验证其能产生合规可审计结果。

Comments Accepted to IntelliSys'2026. To Appear in Springer series "Lecture Notes in Networks and Systems" in 2026

详情

展开后加载摘要…

URL PDF HTML 收藏