arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 136 信号源:cs.CL, cs.AI, cs.LG

1. 代码与定理证明 136 篇

2607.16499 2026-07-21 cs.LO cs.SE 新提交 50%

Show Me The Money: An Exercise in Proof-Driven Software Understanding

给我看钱:一个关于证明驱动软件理解的实践

Joseph Tafese, Karthik Nukala, Hassen Saïdi, Natarajan Shankar, Arie Gurfinkel, Giuliano Losa

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 该研究对成熟工业C++代码库进行证明驱动软件理解,结合大语言模型、PVS和SeaHorn,对恒星区块链SDEX订单簿核心算法形式化分析,发现文档不一致,生成便于检查代码更改的工件,展示了定理证明与模型检查组合为遗留系统提供保证的途径。

Comments CAV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15673 2026-07-20 cs.CR 新提交 50%

Beyond Detection: Agentic Attack Synthesis and Simulation for Smart Contracts

超越检测:智能合约的代理攻击合成与模拟

Xianhao Zhang, Jing Sun, Zijian Zhang, Ye Liu, Zhe Hou, Jiaqi Gao, Yuqiang Sun

专题命中 代码与定理证明 :planning(abstract)

AI总结 研究智能合约漏洞利用验证问题,提出KASS多智能体框架,将自动利用生成分解为多阶段并集成多种机制,在多类智能合约上评估,能成功生成可执行利用及结构化攻击计划,验证效果优于其他工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10621 2026-07-14 cs.SE 新提交 50%

WebDesignIter: Co-Evolving Design Knowledge for Repository-Level Front-End Code Generation

WebDesignIter:用于仓库级前端代码生成的协同进化设计知识

Zheng Pei, Mingwei Liu, Zhenxi Chen, Zihao Wang, Yanlin Wang

专题命中 代码与定理证明 :planning(abstract)

AI总结 研究针对前端开发仓库级代码生成问题,提出WebDesignIter框架,通过持久知识图谱融合设计知识与仓库结构,分两阶段工作,实验证明其相比基线和通用编码代理有优势,凸显设计知识对仓库级代码生成的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05593 2026-07-08 cs.HC 新提交 50%

Collective Cognition in Hybrid Groups: A Network Science Synthesis

混合群体中的集体认知:网络科学综合研究

Babak Hemmatian, Razan Baltaji, Lav R. Varshney

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 研究人工智能代理融入人类团队后混合系统中集体智能的产生,综合网络科学等多学科,通过注意力等视角分析不同网络中集体结果的塑造因素及扩展到混合环境的情况,确定鲁棒效应与需修正之处,得出对相关方面的启示。

Comments Non-authoritative author's version of forthcoming chapter in the Springer Nature Handbook of Hybrid Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05180 2026-07-07 cs.RO cs.CV cs.SY eess.SY 新提交 50%

VLM-CASE: Vision-Language Model Enabled Context-Adaptive Safety Envelopes for Anticipatory Safe Autonomous Driving

VLM-CASE:面向前瞻安全自动驾驶的视觉语言模型赋能上下文自适应安全包络

Tianjia Yang, Ke Li, Ruwen Qin, Xianbiao Hu

机构 * Department of Civil and Environmental Engineering, The Pennsylvania State University(宾夕法尼亚州立大学土木与环境工程系) Department of Civil Engineering, Stony Brook University(石溪大学土木工程系)

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 针对恶劣工况下自动驾驶感知与性能退化、仅能事后响应的问题,提出基于微调VLM的上下文自适应安全包络框架,实现前瞻安全控制,在多场景仿真中性能优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04974 2026-07-07 cs.SE 新提交 50%

A Comprehensive Study of Implementation Bugs in Multi-modal Agents

多模态智能体中实现错误的综合研究

Suwan Li, Lei Bu, Shangqing Liu, Yile Wang, Guangdong Bai, Fuman Xie, Kai Chen, Chang Yue

专题命中 代码与定理证明 :planning(abstract)

AI总结 针对多模态智能体实现错误缺乏系统研究的问题,收集34个智能体,从1268个问题报告中识别出158个错误,开发分类法,实现MATester工具,为多模态智能体错误分类、预防和修复提供参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25561 2026-06-25 cs.CR 新提交 50%

CrypFormBench: Benchmarking Formal Analysis Capability of Large Language Models for Cryptographic Schemes

CrypFormBench:评估大型语言模型在密码方案形式化分析中的能力基准

Zhaoxuan Li, Qionglu Zhang, Hengyuan Liu, Xiaoyan Gu, Xianhui Lu, Hongbo Liu, Bingzheng Wang, Haihui Fan, Ziming Zhao, Rui Zhang, Li Zhou

专题命中 代码与定理证明 :verifier(abstract)

AI总结 提出CrypFormBench基准,涵盖符号与计算安全,评估LLM在密码方案形式化分析中的五项核心能力,发现模型在生成、转换和修正方面表现有限。

Comments 23 pages, 17 figures, FSE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24443 2026-06-24 cs.LO cs.PL 新提交 50%

Verifiable Auto-Formalization of Mathematics Using a Relaxed Natural Formal Language

使用宽松自然形式语言的可验证数学自动形式化

Zhicheng Hui, Lihan Xie, Xingzhi Qi, Zhehao Li, Yingjun Lan, Qinxiang Cao

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 提出一种宽松自然形式语言作为中间目标,通过分阶段精化实现可验证的数学自动形式化,结合规则转换与LLM启发式方法,并利用领域特定策略语言生成验证条件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22413 2026-06-24 cs.SE cs.FL 新提交 50%

Formal-Method-Guided Vibe Coding: Closing the Verification Loop on AI-Generated Safety-Critical Software Through Model-Driven Engineering

形式化方法引导的Vibe编码:通过模型驱动工程关闭AI生成安全关键软件的验证循环

Ran Wei, Le Zhu, Haochi Wang, Jim Woodcock, Fang Yan, Simon Foster, Xiangyang Ji

专题命中 代码与定理证明 :verifier(abstract)

AI总结 提出Forge管道,结合Vibe编码与模型驱动工程,通过多种形式化验证(Dafny、CSP、Isabelle)迭代修正LLM生成的Java代码,生成符合安全标准的验证证据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23666 2026-06-23 stat.OT stat.ME 新提交 50%

Statistical Proof as a Window into Human-AI Collaboration: Practical Insights and a Community Agenda

统计证明作为人机协作的窗口:实践见解与社区议程

Xiaojing Sun, Huayu Tang, Buxin Su, Mateo Matijasevick, Chong Wu, Fei Xue, Bingxin Zhao

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 通过统计证明任务,发现当前通用大语言模型在精确定义问题下可执行技术组件,但在开放或长链推理中不可靠,提出人机协作中人类专业知识应聚焦于问题构建与验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22312 2026-06-23 cs.NI cs.ET cs.IR cs.LO cs.MA 新提交 50%

SHACR: A Graph-Augmented Semi-Autonomous Framework for Multi-Class Conflict Resolution in Smart Home IoT Automation

SHACR:一种用于智能家居物联网自动化中多类冲突解决的图增强半自主框架

Leena Marghalani, Walid Aljoby, Suayb S. Arslan

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 提出SHACR框架,通过有向知识图谱将冲突检测从文本推理转化为确定性多跳图遍历,统一逻辑、语义和物理冲突,结合LLM实现闭环工作流,在203条规则测试中F1从0.59提升至0.95。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21389 2026-06-23 cs.CR 新提交 50%

From Production SIEM to Reusable Cybersecurity Artifacts

从生产SIEM到可复用的网络安全工件

Sidnei Barbieri, Leonardo Vaz de Meneses, Ágney Lopes Roth Ferraz, Wagner Comin Sonaglio, Lourenço Alves Pereira Júnior

专题命中 代码与定理证明 :verifier(abstract)

AI总结 提出一种从生产金融安全运营中心提取、匿名化、结构化并验证SIEM数据的方法,生成可复用的研究工件,并通过训练和测量实验验证其隐私-效用边界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21377 2026-06-23 cs.CR 新提交 50%

ARENA: An Architecture for Measuring the Transferability of Autonomous Cyber Defense

ARENA: 一种衡量自主网络防御可迁移性的架构

Sidnei Barbieri, Ágney Lopes Roth Ferraz, Wagner Comin Sonaglio, Gioliano de Oliveira Braga, Henrique Curi de Miranda, Lourenço Alves Pereira Júnior

专题命中 代码与定理证明 :verifier(abstract)

AI总结 针对生产环境安全运营中心数据难以公开的问题,提出一种从私有生产数据中提取、匿名化、结构化并验证SIEM数据的方法,在保护隐私的同时保留任务相关结构,并通过两个应用案例验证了隐私-效用边界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15122 2026-06-16 cs.SE 新提交 50%

The Hitchhiker's Guide to Program Analysis, Part III: Mostly Harmless LLMs

程序分析漫游指南,第三部分:基本无害的LLMs

Haonan Li, Tianyang Zhou, Manu Sridharan, Hang Zhang, Zhiyun Qian

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 提出Evident系统,将LLM用于构建分析框架,后端形式化验证错误状态不可达,在151个真实警告中正确分类,未漏报任何确认漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13037 2026-06-12 cs.CR cs.SE 新提交 50%

DIG: Oracle-Guided Directed Input Generation for One-Day Vulnerabilities

DIG:面向单日漏洞的Oracle引导定向输入生成

Andrew Bao, Haochen Zeng, Peng Chen, Stephen McCamant, Pen-Chung Yew

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 针对补丁延迟或未完全部署导致的单日漏洞风险,提出Oracle引导的定向输入生成方法DIG,利用补丁揭示触发条件,通过LLM合成Oracle并引导生成器进化与定向模糊测试,在138个真实CVE上触发80个漏洞,超过现有技术。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06727 2026-06-08 cs.RO cs.SY eess.SY 新提交 50%

IDDMBSE: Integrating Data-Driven and Model-Based Systems Engineering for Trusted Autonomous Cyber-Physical Systems

IDDMBSE:集成数据驱动和基于模型的系统工程用于可信自主网络物理系统

John S. Baras, Sai Sandeep Damera, Ryan Matheu, Clinton Enwerem, Praveen M. S. Kumar

机构 * Institute for Systems Research, University of Maryland, College Park(系统研究所,马里兰大学,College Park)

专题命中 代码与定理证明 :planning(abstract)

AI总结 提出IDDMBSE方法,将MBSE V流程与数据驱动循环结合,通过开源工具链PERFECT、TRADES-X和VERITAS实现,在自主地面机器人全生命周期验证其有效性。

Comments 9 pages, 11 figures. This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏