arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 1731 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 1731 篇

2605.10176 2026-05-12 cs.CR cs.AI 57%

When Prompts Become Payloads: A Framework for Mitigating SQL Injection Attacks in Large Language Model-Driven Applications

当提示成为载荷:一种缓解大型语言模型驱动应用中SQL注入攻击的框架

Farzad Nourmohammadzadeh Motlagh, Mehrdad Hajizadeh, Mehryar Majd, Pejman Najafi, Feng Cheng, Christoph Meinel

机构 * Hasso Plattner Institute, University of Potsdam, Germany(波茨坦大学霍斯曼-普拉特研究所, 德国) Chemnitz University of Technology, Chemnitz, Germany(Chemnitz技术大学, Chemnitz, 德国)

专题命中 越狱攻击 :prompt injection(abstract);分类 cs.AI

AI总结 本文提出一种多层安全框架,通过提示清洗、威胁检测和签名控制层缓解LLM介导的SQL注入攻击,实验表明其在检测精度和误报率方面表现优异。

Comments 11 pages

Journal ref ICAART 2026, 18th Int. Conf. on Agents and Artificial Intelligence, pp. 1380-1390, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08460 2026-05-12 cs.CR cs.AI 57%

When Child Inherits: Modeling and Exploiting Subagent Spawn in Multi-Agent Networks

当子代理继承:在多代理网络中建模和利用子代理生成

Ziwen Cai, Yihe Zhang, Xiali Hei

机构 * University of Louisiana at Lafayette(路易斯安那州立大学拉弗奈分校)

专题命中 越狱攻击 :prompt injection(abstract);分类 cs.AI

AI总结 本文研究多代理网络中子代理继承带来的安全风险,指出继承内存可能传播恶意指令,提出通过显式安全不变量进行防御。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01034 2026-05-05 cs.CL 57%

A Theoretical Game of Attacks via Compositional Skills

通过组合技能的攻击理论游戏

Xinbo Wu, Huan Zhang, Abhishek Umrawal, Lav R. Varshney

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Stony Brook University(石溪大学)

专题命中 越狱攻击 :alignment(abstract);分类 cs.CL

AI总结 本文提出一个理论框架,分析攻击者与防御者之间的博弈,设计最优攻击策略并揭示其与现有对抗提示方法的关系,同时推导出可证明最优的防御策略,并通过实验验证其在不同LLM和基准上的优越性。

Comments arXiv admin note: text overlap with arXiv:2505.20841

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28129 2026-05-01 cs.CR cs.AI 57%

Latent Adversarial Detection: Adaptive Probing of LLM Activations for Multi-Turn Attack Detection

潜在对抗检测:适应性探测LLM激活以多轮攻击检测

Prashant Kulkarni

机构 * Mountain View, CA(山景城,加利福尼亚州)

专题命中 越狱攻击 :prompt injection(abstract);分类 cs.AI

AI总结 本文通过分析LLM激活层的轨迹特征,提出对抗性不稳定性概念,提升多轮攻击检测精度,验证了模型家族间的信号一致性及数据分布对泛化能力的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24983 2026-04-29 cs.AI 57%

Adaptive Prompt Embedding Optimization for LLM Jailbreaking

适应性提示嵌入优化用于大语言模型劫持

Miles Q. Li, Benjamin C. M. Fung, Boyang Li, Radin Hamidi Rad, Ebrahim Bagheri

机构 * School of Information Studies, McGill University, Montreal, QC, Canada(麦吉尔大学信息研究学院) Department of Computer Science, Kean University, Union, NJ, United States(凯恩大学计算机科学系) Mila - Quebec AI Institute, Montreal, QC, Canada(魁北克人工智能研究所) Faculty of Information, University of Toronto, Toronto, ON, Canada(多伦多大学信息学院)

专题命中 越狱攻击 :jailbreak(abstract);分类 cs.AI

AI总结 本文提出PEO方法,通过优化原始提示嵌入而非附加对抗性标记,实现更有效的白盒劫持,实验显示其在多个基准测试中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24790 2026-04-29 cs.CR cs.AI 57%

Semantic Denial of Service in LLM-controlled robots

语义拒绝服务在LLM控制的机器人中

Jonathan Steinberg, Oren Gal

机构 * Swarms & AI Lab (SAIL) University of Haifa(群集与人工智能实验室(SAIL)海法大学)

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

AI总结 本文研究了LLM控制机器人中语义拒绝服务攻击,发现通过注入安全可信的短语可触发安全推理中断,提出防御策略需平衡攻击抑制与真实危险响应,强调系统架构而非提示级别的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15384 2026-04-29 cs.CR cs.AI cs.SE 57%

LinuxArena: A Control Setting for AI Agents in Live Production Software Environments

LinuxArena:AI代理在实时生产软件环境中的控制设置

Tyler Tracy, Ram Potham, Nick Kuhn, Myles Heller, Anshul Khandelwal, Cody Rushing, Henri Lemoine, Miguel Brandao, Tomas Turlik, Adam Hanson, Josh Hills, Amy Ngo, Ram Rachum, Nik Mitchell, Falko Galperin, Oscar Sykes, Pip Arnott, Samuel Prieto Lima, Carlos Giudice, Matt Goldwater, Daniel Popp, Drew de Wet, Ruben Castaing, Qi Guo, Douw Marx, Benjamin Shaffrey, Justin Shenk, Martin Milbradt, Hannah Meagher, Shaheen Ahmed-Chowdhury, Daniel O'Connell, Chris Canal, Buck Shlegeris, Aryan Bhatt

机构 * Redwood Research EquiStamp Senior Authors

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

AI总结 LinuxArena是首个大规模多服务生产环境控制设置,包含20个环境、1671个合法任务和184个安全失败任务,用于评估AI代理在实时环境中的控制能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16182 2026-04-28 cs.CR cs.CL 57%

DualGuard: Dual-stream Large Language Model Watermarking Defense against Paraphrase and Spoofing Attack

DualGuard: 双流大语言模型水印防御对抗同义词和伪装攻击

Hao Li, Yubing Ren, Yanan Cao, Yingjie Li, Fang Fang, Shi Wang, Li Guo

机构 * Institute of Information Engineering, Chinese Academy of Sciences(信息工程研究所,中国科学院) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络与信息安全学院) Institute of Computing Technology, Chinese Academy of Sciences(计算技术研究所,中国科学院)

专题命中 越狱攻击 :trustworthy(abstract);分类 cs.CL

AI总结 DualGuard通过双流水印机制有效防御同义词和伪装攻击,提升水印检测的可靠性与可追溯性,实验表明其在多数据集和语言模型上的检测性、鲁棒性和文本质量均表现优异。

Comments Accepted to ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20291 2026-04-28 cs.CV cs.CL 57%

VisRet: Visualization Improves Knowledge-Intensive Text-to-Image Retrieval

VisRet:可视化改进知识密集型文本到图像检索

Di Wu, Yixin Wan, Kai-Wei Chang

机构 * University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 越狱攻击 :alignment(abstract);分类 cs.CL

AI总结 VisRet通过将文本查询投影到图像模态,提升跨模态检索效果,优于传统方法,在四个基准测试中提升nDCG@30,并提高下游问答准确性。

Comments ACL 2026 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23124 2026-04-28 cs.SE cs.AI 57%

ArgRE: Formal Argumentation for Conflict Resolution in Multi-Agent Requirements Negotiation

ArgRE:基于形式论证的多智能体需求协商中的冲突解决

Haowei Cheng, Milhan Kim, Chong Liu, Teeradaj Racharak, Truong Vinh Truong Duy, Phan Thi Huyen Thanh, Jialong Li, Naoyasu Ubayashi, Hironori Washizaki

机构 * Department of Computer Science and Communications Engineering, Waseda University(早稻田大学计算机科学与通信工程系) College of Architecture and Urban Planning, Tongji University(同济大学建筑与城市规划学院) Advanced Institute of So-Go-Chi (Convergence Knowledge) Informatics, Tohoku University(东北大学So-Go-Chi(融合知识)信息学高级研究所) Aisin Corporation(日产公司)

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

AI总结 ArgRE通过嵌入Dung风格的抽象论证,提供多智能体需求协商中的冲突解决,提升可审计性与合规性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22871 2026-04-28 cs.CR cs.AI cs.MA 57%

AutoRISE: Agent-Driven Strategy Evolution for Red-Teaming Large Language Models

AutoRISE:面向大语言模型的代理驱动策略进化

Tanmay Gautam, Alireza Bahramali, Sandeep Atluri

机构 * Responsible AI, Microsoft(微软责任人工智能)

专题命中 越狱攻击 :jailbreak(abstract);分类 cs.AI

AI总结 本文提出AutoRISE,通过代理编辑攻击策略并评估,实现攻击策略的进化,提升了对抗成功率。

Comments 36 pages, 6 tables, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18457 2026-04-24 cs.CV cs.LG 57%

VFM-VAE: Vision Foundation Models Can Be Good Tokenizers for Latent Diffusion Models

VFM-VAE:视觉基础模型可以作为潜在扩散模型的良好分词器

Tianci Bi, Xiaoyi Zhang, Yan Lu, Nanning Zheng

机构 * State Key Laboratory of Human-Machine Hybrid Augmented Intelligence, Institute of Artificial Intelligence and Robotics, Xi’an Jiaotong University(人机混合增强智能国家重点实验室,人工智能与机器人研究院,西安交通大学) Microsoft Research Asia(微软亚洲研究院)

专题命中 越狱攻击 :alignment(abstract);分类 cs.LG

AI总结 本文提出VFM-VAE,利用冻结的视觉基础模型作为潜在扩散模型的分词器,通过设计新解码器提升图像重建能力,实现分词器与扩散模型的协同优化,提升训练效率与性能。

Comments Accepted at CVPR 2026. Code and models available at: https://github.com/tianciB/VFM-VAE

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20771 2026-04-23 cs.CR cs.AI 57%

DAIRE: A lightweight AI model for real-time detection of Controller Area Network attacks in the Internet of Vehicles

DAIRE:一种轻量级AI模型,用于实时检测车联网中的控制器局域网络攻击

Shahid Alam, Amina Jameel, Zahida Parveen, Ehab Alnfrawy, Adeela Ashraf, Raza Uddin, Jamal Aqib

机构 * Department of Information Security, College of Computer Science and Engineering, University of Ha’il(信息安全系,计算机科学与工程学院,哈伊尔大学) Department of Computer Engineering, Center of Excellence in Artificial Intelligence, Bahria University(计算机工程系,人工智能卓越中心,巴赫里大学) Department of Artificial Intelligence, College of Computer Science and Engineering, University of Ha’il(人工智能系,计算机科学与工程学院,哈伊尔大学) Department of Computer Science, College of Computer Science and Engineering, University of Ha’il(计算机科学系,计算机科学与工程学院,哈伊尔大学) Department of Software Engineering, College of Computer Science and Engineering, University of Ha’il(软件工程系,计算机科学与工程学院,哈伊尔大学)

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

AI总结 本文提出DAIRE模型,利用轻量级神经网络实现实时检测和分类CAN攻击,实验显示其在准确率和速度上均优于现有方法。

Journal ref Machine Learning with Applications (2026): 100859

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21893 2026-04-22 cs.LG 57%

Breaking the Illusion: Consensus-Based Generative Mitigation of Adversarial Illusions in Multi-Modal Embeddings

打破幻觉:基于共识的生成对抗多模态嵌入中对抗性幻觉的缓解

Fatemeh Akbarian, Anahita Baninajjar, Yingyi Zhang, Ananth Balashankar, Amir Aminifar

机构 * Lund University(隆德大学) Google DeepMind(谷歌DeepMind)

专题命中 越狱攻击 :alignment(abstract);分类 cs.LG

AI总结 本文提出一种任务无关的缓解机制,利用生成模型恢复多模态嵌入的自然对齐,通过生成采样策略和共识聚合方案提升防御效果,实验显示其显著降低对抗性幻觉攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18663 2026-04-22 cs.CR cs.AI 57%

Beyond Explicit Refusals: Soft-Failure Attacks on Retrieval-Augmented Generation

超越显式拒绝:针对检索增强生成的软故障攻击

Wentao Zhang, Yan Zhuang, ZhuHang Zheng, Mingfei Zhang, Jiawen Deng, Fuji Ren

机构 * University of Electronic Science and Technology of China(电子科技大学) Shenzhen Institute for Advanced Study(深圳先进研究所)

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

AI总结 本文提出DEJA攻击框架,通过进化优化生成对抗文档,诱导系统产生非信息性但流畅的响应,降低回答确定性,实验显示其在多个RAG配置中有效,SASR超过79%。

Comments 22 pages, Accepted to the ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06414 2026-04-22 cs.CR cs.AI 57%

Benchmarking Misuse Mitigation Against Covert Adversaries

对抗隐蔽攻击的误用缓解基准测试

Davis Brown, Mahdi Sabbaghi, Luze Sun, Alexander Robey, George J. Pappas, Eric Wong, Hamed Hassani

机构 * University of Pennsylvania(宾夕法尼亚大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

AI总结 本文提出BSD基准测试,用于评估对抗隐蔽攻击的防御策略,通过生成两个拒绝前沿模型的难数据集,揭示分解攻击的有效性及状态化防御的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23179 2026-04-21 cs.AI 57%

Universal Adversarial Attacks against Closed-Source MLLMs via Target-View Routed Meta Optimization

针对闭源多模态大语言模型的通用对抗攻击:通过目标视角路由元优化

Hui Lu, Yi Yu, Yiming Yang, Chenyu Yi, Xueyi Ke, Qixing Zhang, Bingquan Shen, Alex Kot, Xudong Jiang

机构 * Rapid-Rich Object Search Lab, Interdisciplinary Graduate Programme, Nanyang Technological University, Singapore(快速丰富目标搜索实验室,跨学科研究生项目,南洋理工大学,新加坡) School of Electrical and Electronic Engineering, Nanyang Technological University, Singapore(电气与电子工程学院,南洋理工大学,新加坡) College of Computing and Data Science, Nanyang Technological University, Singapore(计算与数据科学学院,南洋理工大学,新加坡) DSO National Laboratories, Singapore(新加坡国防科学实验室)

专题命中 越狱攻击 :alignment(abstract);分类 cs.AI

AI总结 本文提出MCRMO-Attack,通过多作物聚合与注意力引导裁剪稳定监督,通过对齐性门控令牌路由提升token级可靠性,并元学习跨目标扰动先验,从而在商业MLLM上提升未见图像攻击成功率。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16543 2026-04-21 cs.MA cs.AI 57%

Conjunctive Prompt Attacks in Multi-Agent LLM Systems

多智能体大语言模型中的联合提示攻击

Nokimul Hasan Arif, Qian Lou, Mengxin Zheng

机构 * University of Central Florida(中央佛罗里达大学)

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

AI总结 研究多智能体系统中联合提示攻击的机制与防御,通过路由优化提升攻击成功率并降低误触发率,揭示了智能体流水线的结构性漏洞。

Comments ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11623 2026-04-17 cs.AI cs.SE 57%

Context Kubernetes: Declarative Orchestration of Enterprise Knowledge for Agentic AI Systems

上下文Kubernetes:面向代理AI系统的企业知识声明式编排

Charafeddine Mouzouni

机构 * OPIT -- Open Institute of Technology(开放技术研究所)

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

AI总结 本文提出Context Kubernetes架构,通过声明式知识架构-as-code和三层权限模型,解决企业知识在代理AI系统中的安全编排问题,实验表明其在治理和安全性方面优于传统方法。

Comments 24 pages, 8 tables, 1 figure, 8 experiments (5 correctness + 3 value). Open-source prototype: https://github.com/Cohorte-ai/context-kubernetes

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09784 2026-04-15 stat.ML cs.LG 57%

Discrete Flow Maps

离散流映射

Peter Potaptchik, Jason Yim, Adhi Saravanan, Peter Holderrieth, Eric Vanden-Eijnden, Michael S. Albergo

机构 * Harvard University(哈佛大学) University of Oxford(牛津大学) MIT(麻省理工学院) Kempner Institute(凯普纳研究所)

专题命中 越狱攻击 :alignment(abstract);分类 cs.LG

AI总结 本文提出离散流映射,通过在概率单纯形几何上实现轨迹压缩,解决离散数据生成中的几何不匹配问题,提升离散流模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07749 2026-04-10 cs.CL 57%

Beyond Social Pressure: Benchmarking Epistemic Attack in Large Language Models

超越社会压力:大型语言模型中知识攻击的基准测试

Steven Au, Sujit Noronha

机构 * Independent Researcher(独立研究员)

专题命中 越狱攻击 :alignment(abstract);分类 cs.CL

AI总结 本文提出PPT-Bench基准测试,用于评估大型语言模型中的知识攻击,通过不同压力类型测试模型在面对知识、价值观或身份挑战时的一致性与反应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07615 2026-04-10 cs.CL 57%

ADAG: Automatically Describing Attribution Graphs

ADAG:自动描述归因图

Aryaman Arora, Zhengxuan Wu, Jacob Steinhardt, Sarah Schwettmann

机构 * Stanford University(斯坦福大学) Transluce

专题命中 越狱攻击 :jailbreak(abstract);分类 cs.CL

AI总结 ADAG通过自动化方法描述归因图,利用归因轮廓和聚类算法生成可解释的电路结构,并发现Llama 3.1 8B Instruct中的有害建议 jailbreak聚类。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02670 2026-04-10 cs.CL 57%

Break Me If You Can: Self-Jailbreaking of Aligned LLMs via Lexical Insertion Prompting

攻破我:通过词性插入提示实现对对齐大语言模型的自我越狱

Devang Kulshreshtha, Hang Su, Haibo Jin, Chinmay Hegde, Haohan Wang

机构 * Amazon(亚马逊) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) New York University(纽约大学)

专题命中 越狱攻击 :jailbreak(abstract);分类 cs.CL

AI总结 本文提出自我越狱方法,通过词性插入提示对齐大语言模型进行攻击,实验表明SLIP在多个模型上实现高攻击成功率,提出SDM防御机制但发现其对自适应攻击策略仍不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04951 2026-04-08 cs.CR cs.AI 57%

Synthetic Trust Attacks: Modeling How Generative AI Manipulates Human Decisions in Social Engineering Fraud

合成信任攻击:生成式AI如何操纵人类在社会工程欺诈中的决策

Muhammad Tahir Ashraf

机构 * AAAI Pakistan Chapter(AAAI巴基斯坦分会) PureDesigners Ltd.(PureDesigners有限公司) IBM Watson

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

AI总结 本文提出合成信任攻击(STA)作为正式威胁类别,引入STAM模型,涵盖从敌手侦察到事后利用的完整攻击链,探讨人类决策层的防御策略。

Comments 15 pages, 3 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10610 2026-04-08 cs.CR cs.AI 57%

LaSM: Layer-wise Scaling Mechanism for Defending Pop-up Attack on GUI Agents

LaSM:用于防御GUI代理中弹出攻击的分层缩放机制

Zihe Yan, Jiaping Gui, Zhuosheng Zhang, Gongshen Liu

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 越狱攻击 :alignment(abstract);分类 cs.AI

AI总结 本文提出LaSM机制,通过分层放大关键层的注意力和MLP模块,提升模型对任务相关区域的对齐性,有效防御弹出攻击,同时不影响模型整体能力。

Comments Accepted by CVPR-26

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04255 2026-04-07 cs.LG cs.CR 57%

Towards Unveiling Vulnerabilities of Large Reasoning Models in Machine Unlearning

面向揭示大规模推理模型在机器反向学习中的漏洞

Aobo Chen, Chenxu Zhao, Chenglin Miao, Mengdi Huai

机构 * Iowa State University(爱荷华州立大学)

专题命中 越狱攻击 :alignment(abstract);分类 cs.LG

AI总结 本文研究大规模推理模型在机器反向学习中的安全漏洞,提出一种能生成误导性推理轨迹的攻击方法,并通过白盒和黑盒实验验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04060 2026-04-07 cs.CR cs.AI 57%

CoopGuard: Stateful Cooperative Agents Safeguarding LLMs Against Evolving Multi-Round Attacks

CoopGuard:基于协作代理的有状态多轮防御框架用于抵御LLM的演变攻击

Siyuan Li, Zehao Liu, Xi Lin, Qinghua Mao, Yuliang Chen, Haoyu Li, Jun Wu, Jianhua Li, Xiu Su

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学与工程学院) Department of Computer Science, University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校计算机科学系) Big Data Institute, Central South University(中南大学大数据研究院)

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

AI总结 本文提出CoopGuard,通过协作代理维护和更新内部防御状态,有效应对多轮演变攻击。实验显示其在攻击成功率、欺骗率和攻击效率上均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03205 2026-04-06 cs.CR cs.LG 57%

A Tsetlin Machine-driven Intrusion Detection System for Next-Generation IoMT Security

基于Tsetlin机器的下一代IoMT安全入侵检测系统

Rahul Jaiswal, Per-Arne Andersen, Linga Reddy Cenkeramaddi, Lei Jiao, Ole-Christoffer Granmo

机构 * Department of ICT, University of Agder, Norway(挪威阿格德尔大学信息与通信技术系)

专题命中 越狱攻击 :safety(abstract);分类 cs.LG

AI总结 本文提出一种基于Tsetlin机器的入侵检测系统,用于检测针对IoMT网络的多种网络攻击,通过命题逻辑建模攻击模式,实验表明其在二分类和多分类中均优于传统机器学习分类器。

Comments 8 pages, 15 figures, 9 tables. Accepted at the 7th Silicon Valley Cybersecurity Conference (SVCC 2026), California, USA

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22855 2026-03-25 cs.AR cs.LG 57%

TorR: Towards Brain-Inspired Task-Oriented Reasoning via Cache-Oriented Algorithm-Architecture Co-design

TorR: 向基于大脑的面向任务推理迈进:通过面向缓存的算法-架构联合设计

Hyunwoo Oh, SungHeon Jeong, Suyeon Jang, Hanning Chen, Sanggeon Yun, Tamoghno Das, Mohsen Imani

机构 * Department of Computer Science, University of California, Irvine(加州大学尔湾分校计算机科学系)

专题命中 越狱攻击 :alignment(abstract);分类 cs.LG

AI总结 TorR通过将CLIP式的密集对齐替换为超维(HDC)关联推理,实现了高效的实时推理。在算法层面引入部分相似性重用,在架构层面设计了可扩展的位切内存和轻量控制器,以满足实时性需求,同时在能耗和精度上优于现有基线。

Comments Accepted to DAC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17123 2026-03-19 cs.CR cs.AI 57%

Security Assessment and Mitigation Strategies for Large Language Models: A Comprehensive Defensive Framework

大型语言模型的安全性评估与缓解策略:一种全面的防御框架

Taiwo Onitiju, Iman Vakilinia

机构 * School of Computing University of North Florida(北弗罗里达大学计算学院)

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

AI总结 本文评估了大型语言模型在关键基础设施中的安全风险,提出了一种标准化的评估框架和多层次防御系统,通过测试五种主流模型对1万多个对抗性提示的响应,揭示了安全差异,并开发了高准确率的防御框架。

详情

展开后加载摘要…

URL PDF HTML 收藏