arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 45259 信号源:cs.CL, cs.AI, cs.LG

1. 逻辑推理 3043 篇

2608.07261 2026-08-10 cs.CL 新提交 57%

Why Knowing Both Hops Is Not Enough: Understanding Two-Hop Generalization in Language Models

仅知道两跳信息是不够:理解语言模型中的两跳泛化

Zili Zhang, Yilin Wang, Heng Wang, Herun Wan, Minnan Luo

机构 * Xi’an Jiaotong University(西安交通大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL

AI总结 本研究针对语言模型两跳查询失败问题,在受控环境训练Transformer,揭示其泛化规律与跨层不匹配机制,提出循环式训练策略以提升分布外两跳泛化能力。

Comments 24 pages, 20 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06292 2026-08-07 cs.CL cs.SC 新提交 57%

NeSy-RAG: Neuro-Symbolic RAG for Explainable Question Answering

NeSy-RAG:用于可解释问答的神经符号检索增强生成框架

Jonas Gann, Michael Gertz

机构 * Heidelberg University(海德堡大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL

AI总结 NeSy-RAG是一种模块化神经符号RAG框架,可生成透明推理轨迹,在ShARC基准上以61.1%的准确率优于同模型RAG基线,实现可解释问答。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05864 2026-08-07 cs.AI 新提交 57%

Seeing Is Not Deciding: Can Multimodal LLMs Act as Effective CEOs?

视觉感知不等于决策:多模态大语言模型能成为有效的首席执行官吗?

Yuyang Dai, Xueqing Peng, Yuxia Wang, Preslav Nakov, Zhuohan Xie

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 该研究构建C-SUITEBENCH多模态基准,评估9个前沿模型作为CEO的决策能力,发现多模态输入可提升证据推理但会损害受限资源分配,揭示多模态智能体的视觉感知与受限行动是可分离瓶颈。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05545 2026-08-07 cs.CY cs.AI cs.HC 新提交 57%

Vibe Compiler: A Research-Logic Synthesis Tool That Runs without Prompt Engineering -Toward Enhancing Metacognition for Sustaining Agency in the Age of Generative AI-

Vibe Compiler:无需提示工程即可运行的研究逻辑综合工具——迈向生成式AI时代维持智能体的元认知

Riichiro Mizoguchi, Tomoki Aburatani, Kento Koike, Machi Shimmei

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 针对生成式AI可能侵蚀人类认知智能体的问题,提出基于综合-分析互惠模型的Vibe Compiler工具,通过16个学术参数的本体编译研究想法,以反思性问题引导研究人员,减少对复杂提示的依赖,提升AI辅助推理效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05205 2026-08-07 cs.AI 新提交 57%

Abstract Event Causal Rules: Induction and Application

抽象事件因果规则:归纳与应用

Ziwei Zheng, Peiqiong Chen, Bang Wang

机构 * School of Electronic Information and Communications, Huazhong University of Science and Technology(华中科技大学电子信息与通信学院)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 本研究针对现有实例级因果对泛化缺陷,提出抽象事件因果规则(AECR)及相关归纳系统,构建知识库并设计 AR-GCAE 模型注入 AECR,在 CGEP 任务中提升了事件因果推理与预测性能,尤其对稀有未见样本效果显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05169 2026-08-07 cs.CL 新提交 57%

ConWriter: Transition-Constrained Stateful Long-Form Story Generation with Lightweight Neuro-Symbolic Consistency Control

ConWriter:基于轻量级神经符号一致性控制的带状态长文本故事生成,受过渡约束

Jindong Li, Yang Yang, Zihao Liu, Yutao Yue, Menglin Yang

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL

AI总结 针对现有长故事生成方法易累积各类错误的问题,提出无训练框架ConWriter,通过维护故事状态、验证叙事过渡并结合风险信号实现一致性控制,在ConStory-Bench上完成多模型多任务评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03154 2026-08-05 cs.CL 新提交 57%

ANCHOR-RE: An Agentic Neuro-Symbolic Framework for Grounded Biomedical Relation Extraction

ANCHOR-RE:用于接地生物医学关系抽取的智能体神经符号框架

Shufan Ming, Yikun Han, Gibong Hong, Rui Zhang, Halil Kilicoglu

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL

AI总结 该研究提出ANCHOR-RE框架,将本体引导推理等集成到LLM推理中,在多个BioRE基准及2026年生物医学文章数据集上,该框架性能优于直接LLM提示及部分现有方法,是实用的无训练生物医学文献挖掘方法。

Comments Submitted to Journal of Biomedical Informatics (under review)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03137 2026-08-05 cs.AI 新提交 57%

Verifiable Memory: Learning Unified Memory Management with Local and Global Verifiers for Large Language Model Agents

可验证记忆:为大语言模型智能体学习结合局部与全局验证器的统一记忆管理

Xiaolong Sun, Qichao Wang, Hangyu Li, Liang Chen

专题命中 逻辑推理 :verifier(abstract);分类 cs.AI

AI总结 提出VerMem框架,用含七个原子操作的统一策略管理LTM等状态,结合局部与全局验证器训练,在多基准测试中性能与效率均优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28942 2026-08-05 cs.AI 版本更新 57%

NeSyFS: A Neuro-symbolic Fast-Slow Thinking Framework for LLM Agent under Partial Observability

NeSyFS:部分可观测场景下LLM智能体的神经符号快慢思考框架

Duo Xu, Faramarz Fekri

专题命中 逻辑推理 :planning(abstract);分类 cs.AI

AI总结 该研究针对部分可观测场景下LLM智能体的决策挑战,提出NeSyFS神经符号快慢思考框架,结合知识图谱、TSMC算法与反思模块,在三个基准测试中表现优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01763 2026-08-04 cs.CR cs.AI cs.LO cs.SE 新提交 57%

EntailLLM: Verifying LLM-Generated Vulnerability Discovery Paths with Domain Knowledge via Logic Programming

EntailLLM:通过逻辑编程结合领域知识验证大语言模型生成的漏洞发现路径

Kaustuv Mukherji, Jaikrishna Manojkumar Patil, Colton Payne, Paulo Shakarian, Dana Warmsley, Nigel Stepp, Evelyn Kim

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 EntailLLM通过逻辑编程结合领域知识验证LLM生成的漏洞发现路径,在三类CWE、四个LLM等多组实验中,将合并蕴含率从78%提升至98%,可端到端部署且无需逐设备调优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01528 2026-08-04 cs.LG 新提交 57%

Gram-Space: Structure-Preserving Codebook Compression for Memory-Efficient Neuro-Symbolic AI

Gram-Space:面向内存高效神经符号AI的结构保持码本压缩

Weilun Wang, Wantong Li

机构 * University of California Riverside(加州大学河滨分校)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出Gram-Space压缩框架,通过格拉姆-施密特正交化保留VSA所需点积结构,可降低神经符号AI模型GPU内存使用与推理延迟,提升硬件利用率。

Comments International Conference on Neuro-symbolic Systems (NeuS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00937 2026-08-04 cs.CR cs.AI cs.MA 新提交 57%

Neuro-Symbolic Participation Governance for Verifiable AI Agents in Open Digital Twin Ecosystems

开放数字孪生生态中可验证AI智能体的神经符号参与治理

Juan Li, Wei Cai, Yan Bai

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 该研究针对开放数字孪生生态中AI智能体的验证需求,提出神经符号去中心化治理框架,结合神经推理与制度治理,通过区块链智能合约实现可审计参与,经原型验证可管控开销下保障合规协作。

Comments Accepted at the 2026 IEEE International Conference on Systems, Man, and Cybernetics (SMC 2026), Bellevue, WA, USA, October 4-7, 2026. 7 pages, 1 figure, 5 tables. Code: https://github.com/weicaiuw/verigov-ai (DOI: 10.5281/zenodo.21706699)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17999 2026-08-04 cs.AI cs.CV 版本更新 57%

Do Maps Still Matter for Machines: Revisiting the Role of Choropleth Maps in Foundation Model Spatial Understanding

地图对机器来说仍然重要吗:重新审视分级统计图在基础模型空间理解中的作用

Zhiwei Wei, Yonghe Sun, Zhenjia Liu, Wenjia Xu, Chao He, Weihua Dong, Chunbo Liu, Hua Liao

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 研究探讨分级统计图对基础模型空间理解的作用,引入ChoroplethMap-Bench基准,在三种输入条件下评估22个模型,发现地图能显著提升空间推理,尤其结合符号数据及高层次空间模式理解任务时,证明地图是基础模型空间推理的重要外部表示。

Comments 34 pages, 4 figures, and 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01132 2026-08-04 cs.CL 版本更新 57%

Don't Judge a Book by its Cover: Testing LLMs' Robustness Under Logical Obfuscation

不要只看封面判断一本书:测试LLMs在逻辑混淆下的鲁棒性

Abhilekh Borah, Shubhra Ghosh, Kedar Joshi, Aditya Kumar Guru, Kripabandhu Ghosh

机构 * Manipal University Jaipur(马纳普大学贾普尔分校) Indian Institute of Technology, Patna(印度理工学院帕坦分校) Indian Institute of Science Education and Research, Kolkata(印度科学教育与研究学院科钦分校)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL

AI总结 本研究提出Logifus框架和LogiQAte基准,测试LLMs在逻辑混淆下的鲁棒性,发现混淆显著降低模型性能,揭示当前LLMs缺乏深度理解。

Comments 19 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01982 2026-08-03 cs.CV cs.AI q-bio.BM 版本更新 57%

MolSight: A Graph-Aware Vision-Language Model for Unified Chemical Image Understanding

MolSight: 一种用于统一化学图像理解的图感知视觉语言模型

Wenda Wang, Yihan Tong, Yuwei Hu, Xuchen Pan, Zhewei Wei, Yaliang Li, Bolin Ding

机构 * Renmin University of China(中国人民大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 提出MolSight框架,通过分子拓扑模块和分子接地模块增强视觉语言模型对分子图像的结构理解,在多项化学视觉理解任务中显著优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05150 2026-08-03 cs.SE cs.AI 版本更新 57%

Compiled AI: Deterministic Code Generation for LLM-Based Workflow Automation

编译AI:基于LLM的工作流自动化确定性代码生成

Geert Trooskens, Aaron Karlsberg, Anmol Sharma, Lamara De Brouwer, Max Van Puyvelde, Matthew Young, John Thickstun, Gil Alterovitz, Walter A. De Brouwer

机构 * XY.AI Labs, Palo Alto, CA(XY.AI实验室,帕洛阿尔托) Stanford University School of Medicine, Stanford, CA(斯坦福大学医学院,斯坦福) Cornell University, Department of Computer Science, Ithaca, NY(康奈尔大学计算机科学系,伊萨卡) Brigham and Women’s Hospital / Harvard Medical School, Boston, MA(布莱根妇女医院/哈佛医学院,波士顿)

专题命中 逻辑推理 :planning(abstract);分类 cs.AI

AI总结 本文研究编译AI,一种大语言模型在编译阶段生成可执行代码,随后工作流确定性执行的范式。重点探讨其在高风险企业工作流中的应用,尤其在医疗领域,强调可靠性与可审计性。

Comments 14 pages, 2 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28481 2026-07-31 cs.AI 新提交 57%

A Fuzzy Rule-based Neuro-Symbolic Approach for Pipe Severity Prediction in Sewer Networks

用于污水管网管道严重程度预测的基于模糊规则的神经符号方法

Ngoc Thai Le, Thanh Ma, Umberto Straccia

机构 * Can Tho University(芹苴大学) Istituto di Scienza e Tecnologie dell’Informazione, CNR - ISTI(意大利国家研究委员会信息科学与技术研究所)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 本研究提出一种基于模糊规则的神经符号框架,将神经感知与符号推理解耦,结合Swin Transformer、Weka J48算法和模糊逻辑,在污水管网管道严重程度预测任务中,较仅图像分类提升了多项关键指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13220 2026-07-31 cs.AI cs.CE cs.HC 版本更新 57%

Networked Intelligence: Active Shared Context Graphs for Human-AI Team Science

网络智能:用于人类-人工智能团队科学的主动共享上下文图

Sutanay Choudhury, Jeffrey J. Czajka, Lummy M. O. Monteiro, Erin Bredeweg, Jason McDermott, Katherine Wolf, Alex Beliaev, Josh Elmore, Paul Piehowski, Kylee Tate, Yuqian Gao, Aivett Bilbao, Kelly Stratton, Scott Baker, Jaydeep P. Bardhan, Kristin Burnum Johnson, Chris Oehmen, Robert Rallo

机构 * Pacific Northwest National Laboratory(太平洋西北国家实验室)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 研究旨在培养人类与AI系统间的网络智能。提出Mycelium主动共享工作区,能自动连接人员与智能体,捕获并路由重要信息。通过生物多组学活动测试,验证其可将局部发现转化为实验设计,还对网络智能进行了计算解释。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26602 2026-07-30 cs.NI cs.LG 新提交 57%

Harnessing Large Language Models for Intelligent Resource Allocation in the Internet of Everything

利用大语言模型实现万物互联环境下的智能资源分配

Haijun Zhang, Zhuojun Duan, Zijun Wu, Xu Ma, Yuzheng Ren

专题命中 逻辑推理 :reasoning(abstract);分类 cs.LG

AI总结 该研究针对万物互联的动态资源调度挑战,提出大语言模型驱动的资源分配方案,构建多维调度决策模型并引入反馈模块,仿真显示其在收敛速度等指标上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26393 2026-07-30 cs.AI 新提交 57%

CaM-Wolf: Causal-Aware Multimodal Agents for Social Deduction Games

CaM-Wolf:面向社交推理游戏的因果感知多模态智能体

Zheng Zhang, Nanjie Yao, Jiarui He, Deheng Ye, Peilin Zhao, Hao Wang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Nanyang Technological University(南洋理工大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 该研究针对现有SDG智能体多模态特性缺失的问题,提出首个整合多模态感知生成的CaM-Wolf,经实验验证其游戏性能与交互质量均有提升。

Comments Accepted by ACMMM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26120 2026-07-30 cs.AI 新提交 57%

Even More Deception: Objective Misalignment in Mixed-Motive LLM Multi-Agent Systems

更严重的欺骗:混合动机大型语言模型多智能体系统中的目标不一致

Marylou Fauchard, Florian Carichon, Margarida Carvalho, Golnoosh Farnadi

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 该研究以《狼人杀》为框架,分析LLM多智能体的目标不一致问题,发现其会破坏对抗环境结果且在公开行为中难察觉,凸显需缓解策略。

Comments Accepted at AIWILD@ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24770 2026-07-29 cs.AI cs.HC 新提交 57%

ProcAgent: An Agentic Framework for Procedural Task Guidance on Edge with Human-in-the-Loop

ProcAgent:一种用于边缘端人机协作的过程性任务指导的智能体框架

Azizul Zahid, Subrata Biswas, Bashima Islam, Sai Swaminathan

机构 * University of Tennessee Knoxville(田纳西大学诺克斯维尔分校) Worcester Polytechnic Institute(伍斯特理工学院)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 研究针对家具组装等过程性任务,提出ProcAgent框架,利用提议与验证架构,结合多种技术,在边缘设备上实现实时自适应指导,经多维度评估及用户研究,证明能在不牺牲可用性的情况下于边缘硬件达成自适应过程性辅助。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21859 2026-07-29 cs.AI 版本更新 57%

EviDAG: Auditable Causal DAG Authoring with Biomedical Literature

DAGForge:利用生物医学文献进行可审计的因果DAG创作

Yi-han Sheu, Michael R. Steigman, Yu Zhou, Bo Wang, Fan-Yu Yen, Jordan W. Smoller

机构 * Massachusetts General Hospital(麻省总医院) Harvard University(哈佛大学) Northeastern University(东北大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 该研究针对生物医学因果分析中构建因果DAG多为手动过程的问题,提出DAGForge系统。它能基于研究概念描述创作可审计的因果DAG,经评估在召回率等方面表现良好,减轻了DAG策划负担,支持生物医学研究相关工作。

Comments 10 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12366 2026-07-29 cs.SC cs.AI cs.CV 57%

FactorHD: A Hyperdimensional Computing Model for Multi-Object Multi-Class Representation and Factorization

Yifei Zhou, Xuchu Huang, Chenyu Ni, Min Zhou, Zheyu Yan, Xunzhao Yin, Cheng Zhuo

机构 * Zhejiang University(浙江大学) Key Laboratory of Collaborative Sensing and Autonomous Unmanned Systems of Zhejiang Province(浙江省协同感知与自主无人系统重点实验室)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

Comments 7 pages, 5 figures, 2 tables, to be published in the 62nd DAC (Design Automation Conference) proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24730 2026-07-28 cs.CV cs.AI 新提交 57%

KANEx: Translating Kolmogorov-Arnold Networks' Interpretability to Medical Explainability

KANEx:将柯尔莫哥洛夫-阿诺德网络的可解释性转化为医学可解释性

Krithi Shailya, Ananya Lakshmi Ravi, Venkatanathan K. V., Sowmya S. Sundaram, Gokul S. Krishnan, Aditi Anand, Balaraman Ravindran

机构 * Indian Institute of Technology Madras(印度理工学院马德拉斯分校) Vanderbilt University School of Medicine(范德堡大学医学院)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 研究针对医学应用中视觉模型黑箱问题,提出KANEx框架,利用柯尔莫哥洛夫-阿诺德网络的符号透明度为VLM推理奠基,设计KAN-Map热图生成方法,经实验验证该方法能提升语义相似度、视觉定位及推理质量,为可信医学人工智能发展助力。

Comments MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24312 2026-07-28 cs.CL 新提交 57%

CONSISTRE: A Unified Consistency-Aware Framework for Document-Level Relation Extraction with Large Language Models

CONSISTRE:用于文档级关系抽取的统一一致性感知框架及大语言模型

Mingxuan Sun

机构 * Université de Sherbrooke(舍布鲁克大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL

AI总结 研究针对文档级关系抽取中,大语言模型预测易违反关系约束的问题,提出CONSISTRE统一框架。通过推理时的约束感知等及训练时的知识蒸馏强化学习两条路径解决,实验表明该框架有效提升性能,缩小开源与专有模型差距,增强可靠性。

Comments 13 pages, 2 figures. Submitted to IEEE/ACM Transactions on Audio, Speech, and Language Processing

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22948 2026-07-28 cs.NI cs.AI 新提交 57%

Building AI That Works: ESnet's Pragmatic Approach to AI-Driven Operational Excellence

构建有效的人工智能:ESnet实现人工智能驱动卓越运营的务实方法

Bin Dong, Sukhada Gholba, Brooklin Gore, Shawn Kwang, David Mitchell, Samuel Oehlert, Garrett Stewart, Brendan White, Luke Baker, Ed Balas, Britt Gathright, Chin Guok, Jon-Paul Heron, John MacAuley, Scott Richmond, Chris Robb, Chris Tracy, Kesheng Wu

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 ORBIT项目针对ESnet运营痛点,将智能人工智能集成到ServiceNow平台,采用模块化分层架构,以版本化、测试的“技能”管理工具链,完成多项任务,减少步骤、消除错误模式,获广泛应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22947 2026-07-28 cs.AI cs.MA cs.NI cs.SC 新提交 57%

Let AI Agents Translate Networks, Not Reason About Them

让人工智能代理翻译网络,而非对其进行推理

Hongyu Hè, Maria Apostolaki

机构 * Princeton University(普林斯顿大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 研究针对生产网络缺乏形式模型的问题,提出将人工智能局限于网络工件到形式逻辑规则的翻译,依靠求解器推理,构建TypoNet验证模拟广域网符号模型,能快速可靠回答操作问题及促进故障定位。

Comments 8 pages, 3 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22591 2026-07-28 cs.AI cs.MA 新提交 57%

Lexical discovery in unknown environments orchestrated by Large Language Models

由大语言模型编排的未知环境中的词汇发现

Rafael Sendra-Arranz, Iñaki Dellibarda Varela, Eduardo Rocon, Álvaro Gutiérrez, Manuel Cebrian

专题命中 逻辑推理 :planning(abstract);分类 cs.AI

AI总结 针对未知环境中智能体需开发共享词汇的问题,提出神经符号词汇发现框架,让基于大语言模型的智能体群体进行指称博弈自组织词汇表,通过语义锚定扩展人类词汇,模拟达成共识并表征收敛动态,为自主探索预部署规划迈出第一步。

Comments 32 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20712 2026-07-28 cs.CR cs.AI 交叉投稿 57%

Evaluating Large Language Models for Symbolic Security Protocol Analysis

评估用于符号安全协议分析的大语言模型

Paolo Modesti, Syed Ahmed, Ioannis Sfyrakis, Derek Enodolomwanyi

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 研究评估大语言模型对符号安全协议的分析能力,通过在130个协议上测试GPT和DeepSeek,发现聊天与推理模型各有优劣,在认证目标上表现差,保密性较好,结果不稳定,整体LLMs无法与形式化验证相比,仅可作预筛选。

Comments 36 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏