arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 537 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 提示注入 537 篇

2603.22519 2026-04-01 cs.SE cs.AI cs.PL 70%

LLMON: An LLM-native Markup Language to Leverage Structure and Semantics at the LLM Interface

LLMON:一种面向大语言模型的标记语言,用于在大语言模型接口中利用结构和语义

Michael Hind, Basel Shbita, Bo Wu, Farhan Ahmed, Chad DeLuca, Nathan Fulton, David Cox, Dan Gutfreund

机构 * IBM Research(IBM研究院)

专题命中 提示注入 :safety(abstract);prompt injection(abstract);分类 cs.AI

AI总结 LLMON通过引入一种面向大语言模型的标记语言,使文本的结构和语义元数据能自然地传递给大语言模型,从而提升模型的准确性、安全性和稳定性。

Comments 28 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05066 2026-02-26 cs.CR cs.AI 70%

Bypassing AI Control Protocols via Agent-as-a-Proxy Attacks

通过代理式攻击绕过AI控制协议

Jafar Isbarov, Murat Kantarcioglu

机构 * Department of Computer Science, Virginia Tech(弗吉尼亚理工学院计算机科学系)

专题命中 提示注入 :alignment(abstract);prompt injection(abstract);分类 cs.AI

AI总结 本文提出通过代理式攻击绕过AI监控防御,显示即使大规模监控模型也易受攻击,揭示当前防御机制的脆弱性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10915 2026-02-16 cs.CR cs.AI 70%

Blind Gods and Broken Screens: Architecting a Secure, Intent-Centric Mobile Agent Operating System

无目神祇与破碎屏幕:构建一个安全的、以意图为中心的移动代理操作系统

Zhenhua Zou, Sheng Guo, Qiuyang Zhan, Lepeng Zhao, Shuo Li, Qi Li, Ke Xu, Mingwei Xu, Zhuotao Liu

机构 * Tsinghua University(清华大学)

专题命中 提示注入 :alignment(abstract);prompt injection(abstract);分类 cs.AI

AI总结 本文提出Aura架构,通过结构化交互模型和四项防御支柱,提升移动代理系统的安全性与效率。

Comments 35 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09433 2026-02-11 cs.CR cs.AI 70%

Autonomous Action Runtime Management(AARM):A System Specification for Securing AI-Driven Actions at Runtime

自主动作运行时管理(AARM):为在运行时安全保护AI驱动的动作制定系统规范

Herman Errico

机构 * Independent Researcher, IEEE Member(独立研究者,IEEE会员)

专题命中 提示注入 :alignment(abstract);prompt injection(abstract);分类 cs.AI

AI总结 AARM提出了一种开放规范,旨在通过运行时安全机制保护AI驱动的动作,定义了拦截动作、评估策略和记录凭证等核心功能,以应对AI自主执行带来的安全挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05059 2026-01-09 cs.CV cs.LG 70%

From Understanding to Engagement: Personalized pharmacy Video Clips via Vision Language Models (VLMs)

从理解到参与:通过视觉语言模型(VLMs)生成个性化药学视频片段

Suyash Mishra, Qiang Li, Srikanth Patil, Anubhav Girdhar

机构 * Roche(罗氏) Accenture(埃森哲) Involead

专题命中 提示注入 :alignment(abstract);prompt injection(abstract);分类 cs.LG

AI总结 本文提出基于视觉语言模型和音频语言模型的个性化药学视频片段生成方法,通过剪切合并算法和个性化机制提升生成效率与质量,实现制药行业内容处理的高效自动化。

Comments Contributed original research to top tier conference in VLM; currently undergoing peer review

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19483 2025-11-26 cs.SE cs.AI 70%

Z-Space: A Multi-Agent Tool Orchestration Framework for Enterprise-Grade LLM Automation

Z-Space:面向企业级LLM自动化的一种多智能体工具协调框架

Qingsong He, Jing Nan, Jiayu Jiao, Liangjie Tang, Xiaodong Xu, Mengmeng Sun, Qingyao Wang, Minghui Yan

机构 * Rajax Network Technology (ele.me)(Rajax网络技术(ele.me))

专题命中 提示注入 :alignment(abstract);prompt injection(abstract);分类 cs.AI

AI总结 Z-Space通过多智能体协作框架提升企业级LLM自动化工具调用效率与准确性

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.06493 2025-10-21 cs.CR cs.AI 70%

System Prompt Poisoning: Persistent Attacks on Large Language Models Beyond User Injection

Zongze Li, Jiawei Guo, Haipeng Cai

机构 * University at Buffalo(布法罗大学)

专题命中 提示注入 :jailbreak(abstract);prompt injection(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05106 2025-10-10 cs.AI 70%

Rule Encoding and Compliance in Large Language Models: An Information-Theoretic Analysis

Joachim Diederich

专题命中 提示注入 :safety(abstract);prompt injection(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08646 2025-09-11 cs.CR cs.AI cs.SY eess.SY 70%

Architecting Resilient LLM Agents: A Guide to Secure Plan-then-Execute Implementations

Ron F. Del Rosario, Klaudia Krawiecka, Christian Schroeder de Witt

专题命中 提示注入 :prompt injection(abstract);trustworthy(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15613 2025-07-22 cs.CR cs.AI 70%

Multi-Stage Prompt Inference Attacks on Enterprise LLM Systems

Andrii Balashov, Olena Ponomarova, Xiaohua Zhai

机构 * Ukrainian State University of Science and Technologies, ESI "Prydniprovska State Academy of Civil Engineering and Architecture(乌克兰科学与技术国家大学,埃斯I普里皮亚特斯卡州立建筑与工程学院) Google DeepMind(谷歌DeepMind)

专题命中 提示注入 :safety(abstract);prompt injection(abstract);分类 cs.AI

Comments 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.11880 2024-06-19 cs.CR cs.LG 70%

Knowledge Return Oriented Prompting (KROP)

Jason Martin, Kenneth Yeung

专题命中 提示注入 :alignment(abstract);prompt injection(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06185 2026-08-19 cs.CY cs.AI cs.CL cs.HC 版本更新 67%

Hidden Prompts in Manuscripts Exploit AI-Assisted Peer Review

手稿中的隐藏提示利用AI辅助同行评审

Zhicheng Lin

机构 * Department of Psychology, Yonsei University(延世大学心理学系) Department of Psychology, University of Science and Technology of China(中国科学技术大学心理学系)

专题命中 提示注入 :prompt injection(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 研究探讨了手稿中隐藏指令对AI同行评审的影响,分析了提示注入技术及学术出版物政策的不一致,指出需加强技术筛查与政策协调。

Journal ref Communications of the ACM, 69(7), 53-56 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00992 2026-08-19 cs.AI cs.CL cs.CY cs.HC 版本更新 67%

Evidence of conceptual mastery in the application of rules by Large Language Models

大型语言模型在规则应用中展现出概念掌握能力的证据

José Luiz Nunes, Guilherme FCF Almeida, Brian Flanagan

专题命中 提示注入 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文通过两项心理学实验发现,Gemini Pro等部分LLMs在规则应用上展现类人表现,证实LLMs掌握规则概念,对法律决策与哲学探究有启示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14876 2026-08-18 cs.CR cs.AI cs.CL cs.LG 新提交 67%

Workspace Topology as an Attack Vector in Agentic Coding Assistants

工作空间拓扑作为智能体代码助手的攻击向量

Alexandre G. R. Day, Pradeep Yadlapalli, Sriram Venkatapathy, Thomas Paniagua, Nick Raines, Sahil Wadhwa, Himanshu Kumar, Andy Luo, Sudeep Panyam, Rikhiya Ghosh, Pranab Mohanty, Giri Iyengar

专题命中 提示注入 :prompt injection(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究将工作空间拓扑作为攻击向量,发现其会影响智能体代码助手的间接提示注入攻击成功率,高度模块化环境及安全提示可降低攻击成功率,为代码智能体安全测试提供实用价值。

Comments 15 pages, 10 figures. Preprint of a paper accepted at the Conference on Applied Machine Learning in Information Security (CAMLIS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12172 2026-08-13 cs.MA 新提交 67%

Rethinking Agent Security as a Networking Problem

将智能体安全重新思考为一个网络问题

Van Tran, Taveesh Sharma, Tajveer Singh Dhesi, Nick Feamster

专题命中 提示注入 :safety(abstract);prompt injection(abstract)

AI总结 该研究针对现有以智能体为中心的安全防御无法可靠防范AI智能体风险的问题,借鉴网络领域原则,提出结合确定性执行与语义策略的AI智能体安全系统设计思路。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02018 2026-08-07 cs.CV 版本更新 67%

Invisible Ink Threats: Adversarial Goals Behind Legitimate Tasks in Computer-Use Agents

隐形墨水威胁:计算机使用智能体中合法任务背后的对抗目标

Jia-Chen Zhang, Ze-Yu Zhang, Kai-Wei Zhang

专题命中 提示注入 :safety(abstract);prompt injection(abstract)

AI总结 该研究针对计算机使用智能体的隐形墨水威胁,构建II-Bench与HITLCUA框架评估后发现,低危害注入可绕过防御,暴露出现有CUAs的安全风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01635 2026-08-04 cs.CV 新提交 67%

Mitigating Visual Degradation in MLLMs via Spatial-Spectral Visual Anchor Learning

通过空间-光谱视觉锚学习缓解多模态大语言模型(MLLMs)中的视觉退化

Qianlong Yang, Bowen Ye, Xianda Guo, Yanlun Peng, Wenke Huang, Hongyuan Zhang, Yulei Jia

机构 * China University of Petroleum (East China)(中国石油大学(华东)) Shanghai Jiao Tong University(上海交通大学) Wuhan University(武汉大学) Great Wall Motor(长城汽车) Nanyang Technological University(南洋理工大学) The University of Hong Kong(香港大学)

专题命中 提示注入 :alignment(abstract);prompt injection(abstract)

AI总结 针对MLLMs推理时的视觉表示退化问题,提出SSVAL方法,通过VAPI及辅助对齐损失实现稳定视觉锚,性能优于现有方法。

Comments This paper has been accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26497 2026-05-27 cs.CR 67%

Aligning Provenance with Authorization: A Dual-Graph Defense for LLM Agents

对齐来源与授权:面向LLM智能体的双图防御

Peiran Wang, Ying Li, Yuan Tian

专题命中 提示注入 :alignment(abstract);prompt injection(abstract)

AI总结 提出AuthGraph双图对齐防御框架,通过构建注入推理图与授权图的结构化比较,检测工具调用和参数来源级别的偏差,在AgentDojo上将攻击成功率从40%降至1%并保持76%任务完成率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11516 2026-05-13 cs.NI 67%

Agents Should Replace Narrow Predictive AI as the Orchestrator in 6G AI-RAN

智能体应取代窄预测AI作为6G AI-RAN的协调者

Pranshav Gajjar, Vijay K Shah

专题命中 提示注入 :alignment(abstract);prompt injection(abstract)

AI总结 本文主张为实现Level 5自主6G网络,AI-RAN应从碎片化的窄预测模型转向多模态大语言模型作为核心推理智能体,通过提升LLM作为认知操作系统,动态翻译人类意图并自主诊断网络异常。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15751 2026-03-09 cs.AI cs.CL cs.LG 67%

Sysformer: Safeguarding Frozen Large Language Models with Adaptive System Prompts

Sysformer: 通过自适应系统提示保护冻结的大语言模型

Kartik Sharma, Yiqiao Jin, Vineeth Rakesh, Yingtong Dou, Menghai Pan, Mahashweta Das, Srijan Kumar

机构 * Georgia Institute of Technology(佐治亚理工学院) Visa Research(Visa研究)

专题命中 提示注入 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Sysformer通过自适应系统提示提高大语言模型的安全性,显著提升对有害提示的拒绝率和对安全提示的合规性。

Comments ICLR 2026. Code available at https://github.com/Ksartik/sysformer

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04520 2025-12-05 cs.CV 67%

Boundary-Aware Test-Time Adaptation for Zero-Shot Medical Image Segmentation

面向边界的测试时适应用于零样本医学图像分割

Chenlin Xu, Lei Zhang, Lituan Wang, Xinyu Pu, Pengfei Ma, Guangwu Qian, Zizhou Wang, Yan Wang

机构 * School of Computer Science, Sichuan University(四川大学计算机学院) Pittsburgh Institute, Sichuan University(四川大学匹兹堡学院) Institute of High Performance Computing, Agency for Science, Technology and Research (A*STAR)(科技研究局高性能计算研究所)

专题命中 提示注入 :alignment(abstract);prompt injection(abstract)

AI总结 BA-TTA-SAM通过测试时适应提升SAM在医学图像零样本分割中的性能,采用高斯提示注入和边界感知注意力对齐机制,实现12.4%的Dice分数提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15775 2025-09-22 cs.SD eess.AS 67%

EmoQ: Speech Emotion Recognition via Speech-Aware Q-Former and Large Language Model

Yiqing Yang, Man-Wai Mak

机构 * Department of Electrical and Electronic Engineering, The Hong Kong Polytechnic University(电子与电气工程系,香港理工大学)

专题命中 提示注入 :alignment(abstract);prompt injection(abstract)

Comments 5 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17034 2026-07-14 cs.CL cs.LG 版本更新 66%

KVEraser: Learning to Steer KV Cache for Efficient Localized Context Erasing

KVEraser: 学习操控KV缓存以实现高效的局部上下文擦除

Mufei Li, Shikun Liu, Dongqi Fu, Haoyu Wang, Yinglong Xia, Hong Li, Hong Yan, Pan Li

机构 * Georgia Institute of Technology(佐治亚理工学院) Meta

专题命中 提示注入 :prompt injection(abstract);分类 cs.CL、cs.LG;trustworthy(comments)

AI总结 提出KVEraser方法,通过学习操控KV缓存实现局部上下文擦除,避免全局重计算,在长上下文任务中接近全重算性能且延迟仅增加24%。

Comments Oral at the ICML 2026 Workshop on the Impact of Memorization on Trustworthy Foundation Models; Code available at https://github.com/Graph-COM/KVEraser

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00181 2026-02-10 cs.CR cs.AI cs.LG 66%

CHAI: Command Hijacking against embodied AI

CHAI:针对具身AI的命令劫持

Luis Burbano, Diego Ortiz, Qi Sun, Siwei Yang, Haoqin Tu, Cihang Xie, Yinzhi Cao, Alvaro A Cardenas

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI、cs.LG;trustworthy(comments)

AI总结 CHAI是一种针对具身AI的物理环境间接提示注入攻击,通过嵌入误导性自然语言指令,利用多模态语言解释能力,有效提升了攻击性能,凸显了对传统对抗鲁棒性之外的防御需求。

Comments This work has been accepted for publication at the IEEE Conference on Secure and Trustworthy Machine Learning (SaTML). The final version will be available on IEEE Xplore

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16068 2026-08-18 cs.CL cs.AI 新提交 62%

CAPO: Constraint-Aware Prompt Optimization for LLM Agents

CAPO:面向大语言模型智能体的感知约束提示优化

Victor Ye Dong, Reid Pryzant, Yi Liu, Jian Jiao

机构 * Microsoft(微软)

专题命中 提示注入 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出CAPO与DCAPO两种方法,通过原始对偶框架优化LLM智能体的系统提示,在智能体及助手式任务中均提升了可行性与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04192 2026-08-06 cs.CR cs.AI cs.CL 新提交 62%

Behavioral Skill Reconstruction: Reconstructing Hidden Functionality from LLM Agent Skills

行为技能重构:从大语言模型智能体技能中重构隐藏功能

Peichun Hua, Haoxuan Xu, Mengyuan Li

专题命中 提示注入 :prompt injection(abstract);分类 cs.CL、cs.AI

AI总结 本文提出SkillClone黑盒攻击方法,可通过合法交互从隐藏的LLM智能体技能中重构其功能,表明仅文件保密无法确保功能保密。

Comments 20 pages, 5 figures, 20 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20381 2026-08-05 cs.CL cs.AI cs.HC 版本更新 62%

The production of meaning in the processing of natural language

自然语言处理中意义产生的机制

Christopher J. Agostino, Quan Le Thien, Nayan D'Souza, Louis van der Elst

机构 * Department of Physics, Indiana University(印第安纳大学物理系) Department of Linguistics, Indiana University(印第安纳大学语言学系) Imperial College London(伦敦帝国学院)

专题命中 提示注入 :prompt injection(abstract);分类 cs.CL、cs.AI

AI总结 研究自然语言处理中意义产生的机制,探讨量子逻辑与经典布尔理论在语义处理中的差异,分析模型在不同参数下的表现及对安全交互的影响。

Comments Accepted to QNLP 2026, 9 pages, 3 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19837 2026-07-23 cs.AI cs.CR cs.LG 新提交 62%

Know Your Agent: Reconnaissance-Driven Pentesting of AI Agents

了解你的智能体:基于侦察的人工智能智能体渗透测试

Or Zion Eliav, Eyal Lenga, Shir Bernstien, Yisroel Mirsky

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI、cs.LG

AI总结 研究针对人工智能智能体的渗透测试,提出通过形式化智能体侦察,在KYA框架中利用探测、构建配置文件等实现黑盒侦察驱动的渗透测试自动化,并进行评估与发布,以提升智能体安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02240 2026-07-20 cs.CR cs.AI cs.CL cs.ET 版本更新 62%

AgentRedBench: Dynamic Redteaming and Integration-Aware Defense for LLM Agents over SaaS Integrations

AgentRedBench: 针对SaaS集成的LLM代理的动态红队测试与集成感知防御

Hiskias Dingeto, William Leeney

机构 * StackOne Technologies(StackOne技术公司)

专题命中 提示注入 :prompt injection(abstract);分类 cs.CL、cs.AI

AI总结 针对LLM代理在工具使用中面临的间接提示注入威胁,提出动态红队基准AGENTREDBENCH(覆盖24个企业集成、5种攻击类型)和基于集成多样语料训练的防御模型AGENTREDGUARD,将攻击成功率从69.9%降至2.4%,误报率仅0.37%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26595 2026-06-16 cs.CR cs.AI cs.LG 版本更新 62%

Cordyceps: Covert Control Attacks on LLMs via Data Poisoning

Cordyceps: 通过数据投毒对LLM的隐蔽控制攻击

Zedian Shao, Charles Fleming, Teodora Baluta

机构 * Georgia Institute of Technology(佐治亚理工学院) Cisco Systems(思科系统)

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI、cs.LG

AI总结 提出一种数据投毒方法,通过语义关联教LLM隐藏任意恶意指令,实现隐蔽控制攻击,绕过多种防御。

Comments USENIX Security '26

详情

展开后加载摘要…

URL PDF HTML 收藏