arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-08-31 至 2026-08-31 共收录 81 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 4 篇

2510.09260 2026-08-31 cs.CR cs.LG 版本更新 90%

GREAT: Generalizable Backdoor Attacks in RLHF via Emotion-Aware Trigger Synthesis

GREAT: 通过情感感知触发器在RLHF中实现可泛化的后门攻击

Subrat Kishore Dutta, Yuelin Xu, Piyush Pant, Xiao Zhang

机构 * CISPA Helmholtz Center for Information Security(CISPA赫尔姆霍茨信息安全中心)

专题命中 偏好对齐 :RLHF(title,title_cn);分类 cs.LG

AI总结 提出GREAT框架,利用情感感知触发器在RLHF中构造自然分布后门,通过潜在空间聚类和多样性提示策略生成愤怒触发器,实现对未见触发器的泛化攻击。

Comments Accepted in EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27505 2026-08-31 cs.CL cs.AI 新提交 85%

A Survey on Rubric-Guided Reinforcement Learning for Language Models

面向语言模型的准则引导强化学习综述

Zifei Shan, Fangning Shao

机构 * WeChat, Tencent(腾讯微信)

专题命中 偏好对齐 :RLHF(summary_cn,abstract);alignment(abstract);分类 cs.CL、cs.AI

AI总结 该综述针对传统RLHF的缺陷,提出贝叶斯框架并沿先验-后验轴分类准则引导强化学习,分析语言学相关对齐问题,明确未来研究方向。

Comments Accepted to Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27910 2026-08-31 cs.AI cs.CL cs.GT 新提交 84%

AI Alignment through a Game-theoretic Lens: A Survey

基于博弈论视角的AI对齐:一项综述

Yanan Cai, Zhongrui Zhao, Zhigang Lu, Ickjai Lee, Wei Emma Zhang, Minhui Xue, Yihong Zhang, Shuchao Pang, Wei Xiang

机构 * James Cook University(詹姆斯库克大学) Western Sydney University(西悉尼大学) Adelaide University(阿德莱德大学) CSIRO(联邦科学与工业研究组织) The University of Osaka(大阪大学) Nanjing University of Science and Technology(南京理工大学) Macquarie University(麦考瑞大学) La Trobe University(拉筹伯大学)

专题命中 偏好对齐 :alignment(title,abstract);harmlessness(abstract);分类 cs.CL、cs.AI

AI总结 本综述从博弈论视角梳理AI对齐的近期进展,针对偏好多样性等三大挑战整合相关文献,明确了博弈论在AI对齐中的作用、不足及未来构建稳健AI系统的挑战。

Comments This paper has been accepted by EMNLP-2026 as a main conference paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28387 2026-08-31 cs.AI cs.LG 版本更新 73%

Prompts Without Evidence: How Neuroimaging Mentions Shift Clinical Vision-Language Model Predictions

脚手架效应:提示框架如何驱动临床VLM评估中的表面多模态增益

Doan Nam Long Vu, Simone Balloccu

机构 * Technical University of Darmstadt(达姆施塔特技术大学)

专题命中 偏好对齐 :alignment(abstract);trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 研究发现,在临床VLM评估中,提示中提及MRI可用性即可解释70-80%的性能提升,与图像数据是否存在无关,这种“脚手架效应”揭示了表面评估无法反映真实多模态推理能力。

Comments Accepted to EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全训练 13 篇

2509.19212 2026-08-31 cs.CL cs.AI 版本更新 86%

Steering Multimodal Large Language Models Decoding for Context-Aware Safety

面向上下文感知安全的多模态大语言模型解码引导

Zheyuan Liu, Zhangchen Xu, Guangyao Dou, Xiangchi Yuan, Zhaoxuan Tan, Radha Poovendran, Meng Jiang

机构 * University of Notre Dame(notre dame 大学) University of Washington(华盛顿大学) Johns Hopkins University(约翰霍普金斯大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 安全训练 :safety(title,abstract);alignment(abstract);分类 cs.CL、cs.AI

AI总结 针对多模态大语言模型安全对齐的平衡难题,提出SafeCoDe解码框架,通过两阶段机制优化上下文敏感的弃权行为,在多基准实验中有效提升安全性能且保留模型有用性。

Comments EMNLP 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12066 2026-08-31 cs.LG cs.AI cs.CL 版本更新 85%

The Instability of Safety: How Random Seeds and Temperature Expose Inconsistent LLM Refusal Behavior

安全性的不稳定性:随机种子和温度如何暴露LLM拒绝行为的一致性问题

Erik Larsen

专题命中 安全训练 :safety(title,abstract);alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究发现LLM在随机种子和温度变化下安全拒绝行为不稳定,提出安全性稳定性指数并推荐多样本评估以提高可靠性。

Comments 17 pages, 7 figures, 9 tables. Code and data available at this https URL (https://github.com/erikl2/safety-refusal-stability). v3: corrects dataset attribution (AdvBench+HarmBench, not BeaverTails), fixes label-derived statistics and CIs, revises the judge-noise analysis to a sensitivity framing; conclusions unchanged

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24418 2026-08-31 cs.CR 版本更新 82%

GSPR: Aligning LLM Safeguards as Generalizable Safety Policy Reasoners

GSPR:将大语言模型(LLM)安全防护措施对齐为可泛化的安全策略推理器

Haoran Li, Jingru Zeng, Yulin Chen, Huihao Jing, Wenbin Hu, Hao Peng, Haochen Shi, Xi Yang, Ziqian Zeng, Sirui Han, Yangqiu Song

专题命中 安全训练 :safety(title,abstract)

AI总结 针对现有LLM安全防护措施泛化性不足的问题,提出可泛化安全策略推理器GSPR,通过强化学习在多安全基准训练后提升安全与类别预测能力,且推理token成本更低。

Comments Accepted by EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27580 2026-08-31 cs.AI 新提交 79%

LongGuard: Mechanistic Analysis and Training-Free Mitigation of Long-Context Failure in Safety Guardrails

LongGuard:针对安全护栏长上下文失效的机制分析与无训练缓解方案

Ziyang Chen, Xing Wu, Songlin Hu

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

AI总结 本研究针对LLM安全护栏在长上下文下的失效问题,提出LongGuard框架,经机制分析后开发无训练缓解方案,在多基准测试中实现显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24662 2026-08-31 cs.NI 版本更新 71%

OpenTwin: Closed-Loop Digital Twins for Trustworthy Policy Deployment in Open RAN

OpenTwin:面向开放RAN的数字孪生驱动闭环KPM推理与控制

Zifan Zhang, Md Sharif Hossen, Dara Ron, Vijay K. Shah, Yuchen Liu

专题命中 安全训练 :trustworthy(title)

AI总结 针对O-RAN中KPM数据稀缺和AI模型直接部署风险,提出基于开源模拟器和O1接口的数字孪生框架OpenTwin,采用XGBoost与递归最小二乘两步ML方法实现高精度KPM镜像与节能控制。

Comments 13 pages, 5 tables, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28010 2026-08-31 cs.LG cs.AI 新提交 62%

When Can Conditional Flow Matching Replace Pointwise Negative Log-Likelihood?

条件流匹配何时能替代逐点负对数似然?

Yansen Han, Hongxin Sun, Tao Lin

机构 * Zhejiang University(浙江大学) Westlake University(西湖大学) Fudan University(复旦大学)

专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文通过理论分解刻画了条件流匹配(CFM)可替代逐点负对数似然(NLL)的条件,指出其在离策略总体最优处的局限性,相关结论及分解为适配LLM方法至流匹配提供了理论基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28407 2026-08-31 cs.CL 新提交 57%

A Unified Framework to Elicit Structured Feedback for Interpretable Multi-Trait Essay Scoring

用于可解释多特质作文评分的结构化反馈提取统一框架

Shihang Yang, Sanwoo Lee, Ningning Zhao, Yunfang Wu

机构 * Peking University(北京大学) Beijing Normal University(北京师范大学)

专题命中 安全训练 :alignment(abstract);分类 cs.CL

AI总结 该研究针对多特质自动作文评分中反馈与评分分离的问题,提出统一框架HiFTS,结合教师LLM提炼反馈并训练学生模型,在新数据集CFMS-34及ASAP++上取得优异评分与反馈效果。

Comments 14 pages, accepted to EMNLP 2026 Findings. Code: this https URL (https://github.com/Atiyahsama/HiFTS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28399 2026-08-31 cs.AI q-fin.TR 新提交 57%

RetailAgent: Structured Adverse Timing in Self-Conditioned Multimodal LLM Trading Agents

RetailAgent:自条件多模态大语言模型交易智能体中的结构化不利时机

Yupeng Zhang, Liuyuan Jiang, Hongyi Huang, Bingheng Li, Lisha Chen

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Michigan State University(密歇根州立大学) University of Rochester(罗切斯特大学)

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 该研究提出RetailAgent框架,发现LLM交易智能体的决策存在跨维度的持续不利时机,动作与后续收益的一致性是该效应的关键驱动因素,同时自生成记忆会增强策略持续性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28233 2026-08-31 cs.AI 新提交 57%

REINS: Refusal-Enhanced Inhibitory Steering with Sparse Autoencoder Features

REINS:基于稀疏自编码器特征的增强拒绝抑制引导方法

Kai-Xuan Ding, Hao-Xiang Xu, Ji-Hua Peng, Zi-Qi Chen, Jiaqi Wang, Zhen-Hua Ling

机构 * University of Science and Technology of China(中国科学技术大学) Zhejiang University(浙江大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本研究针对现有SAE引导方法在复杂包装器有害提示上的不足,提出REINS方法,可抑制有害特征、增强安全弃权特征,在GUISE等数据集上大幅减少有害响应并保留模型通用能力。

Comments Accepted at EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27844 2026-08-31 cs.CL 新提交 57%

EvoHarmBench: Breaking Content Moderation with Iterative Human-Like Evasion

EvoHarmBench:通过类人迭代规避突破内容审核

Ruijie Jian, Benlei Cui, Ting Ma, Haidong Ding, Kangwei Liu, Ziwen Xu, Longtao Huang, Hui Xue, Ziqiang Zhu, Junjie Li, Haiwen Hong

机构 * Yuvion Team, Alibaba Group(阿里巴巴集团Yuvion团队) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 安全训练 :safety(abstract);分类 cs.CL

AI总结 该研究提出首个动态对抗评估框架EvoHarmBench,针对5类违规229个语义子簇的5002个样本评估LLM审核模型,发现SOTA模型经12次迭代后规避成功率达80.3%,将推动内容安全评估转向动态模式。

Comments Accepted to the Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02009 2026-08-31 cs.AI 版本更新 57%

HALT: Verification-Aware Stopping for Retrieval-Augmented Search Agents

HALT:面向检索增强搜索智能体的感知验证式停止策略

Daeyoung Roh, Donghee Han

机构 * KAIST(韩国科学技术院)

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 该研究针对检索增强搜索智能体的冗余检索问题,提出轻量级感知验证停止策略HALT,在三个多跳QA基准上减少冗余搜索且保持精确匹配,无需修改宿主智能体。

Comments Accepted to Findings of EMNLP 2026. 23 pages, 6 figures. Code: this https URL (https://github.com/Noverse0/HALT)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28532 2026-08-31 cs.NI eess.SY 新提交 50%

xTRUCE: A Provably Safe Arbiter for Multi-xApp Conflict Mitigation in Agentic O-RAN

xTRUCE:面向智能体开放式无线接入网(O-RAN)中多xApp冲突缓解的可证明安全仲裁器

Le Xia, Rose Qingyang Hu, Paul S. Kudyba, Zhenlin An, Haijian Sun

专题命中 安全训练 :safety(abstract)

AI总结 针对O-RAN中LLM驱动xApp提案的冲突等问题,提出可证明安全的仲裁器xTRUCE,通过三层约束层次与两阶段仲裁机制保障gNB控制安全,经仿真和空中实验验证其有效性。

Comments 13 pages, 7 figures. This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27726 2026-08-31 cs.RO 新提交 50%

Coordinated Motion Planning for Multi-Arm Systems via Iterative LQ Games

基于迭代LQ博弈的多机械臂系统协调运动规划

Junyoung Kim, Hanwen Ren, Lei Zhang, Ahmed H. Qureshi

机构 * Purdue University(普渡大学)

专题命中 安全训练 :safety(abstract)

AI总结 本文提出迭代LQ博弈框架用于多机械臂协调运动规划,通过可微碰撞惩罚生成安全高效轨迹,性能优于传统方法,凸显微分博弈在多机器人操作中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 越狱攻击 8 篇

2605.12015 2026-08-31 cs.CR cs.AI cs.CL cs.LG cs.MA 版本更新 85%

SkillSafetyBench: Evaluating Agent Safety under Skill-Facing Attack Surfaces

SkillSafetyBench:在技能面攻击表面下评估智能体安全性

Chang Jin, An Wang, Zeming Wei, Kai Wang, Biaojie Zeng, Qiaosheng Zhang, Chao Yang, Jingjing Qu, Xia Hu, Xingcheng Xu

机构 * Shanghai AI Laboratory(上海人工智能实验室) Peking University(北京大学) East China Normal University(华东师范大学)

专题命中 越狱攻击 :safety(title,abstract);alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出SkillSafetyBench基准,通过155个对抗案例评估大语言模型智能体在技能、本地工件和执行环境文件等非用户攻击下的安全失败模式。

Comments EMNLP 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26971 2026-08-31 cs.CV cs.MM 版本更新 82%

TempJail: Temporal Jailbreak Attacks against Image-to-Video Generation Models

TempJail:针对图像到视频生成模型的时序越狱攻击

Qi Lu, Zehui Guo, David Yuanda Gan, Zijing Li, Hengda Zhang, Weijun Xu, Qiankun Zhang

机构 * School of Cyber Science and Engineering, Huazhong University of Science and Technology(华中科技大学网络空间科学与工程学院) School of Mathematical Sciences, Peking University(北京大学数学科学学院) School of Software and engineering, Huazhong University of Science and Technology(华中科技大学软件学院) School of Computer Science, Nanjing University(南京大学计算机学院)

专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract)

AI总结 本文提出TempJail时序越狱框架,针对图像到视频生成模型的时序漏洞,通过分解恶意提示、受控潜在扰动等方式提升攻击成功率,在Kling等模型上获显著效果。

Comments Accepted by ACM Multimedia 2026 (ACM MM '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18154 2026-08-31 cs.CL cs.AI cs.DB 版本更新 81%

FENCE: A Financial and Multimodal Jailbreak Detection Dataset

FENCE:一个金融和多模态越狱检测数据集

Mirae Kim, Seonghun Jeong, Youngjun Kwak

专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.CL、cs.AI

AI总结 针对金融领域多模态越狱检测资源匮乏的问题,提出FENCE数据集,包含韩英双语文本和图像,用于训练和评估检测器,实验表明基线检测器准确率达99%。

Comments lrec 2026 accepted paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19423 2026-08-31 cs.CR cs.AI cs.LG 版本更新 79%

The Autonomy Tax: Defense Training Breaks LLM Agents

自主性税:防御训练破坏LLM智能体

Shawn Li, Yue Zhao

机构 * University of Southern California(南加州大学)

专题命中 越狱攻击 :alignment(abstract);safety(abstract);prompt injection(abstract);分类 cs.AI、cs.LG

AI总结 揭示防御训练在提升LLM智能体安全性时,系统性地破坏其工具执行能力,导致任务失败率飙升,且无法有效防御复杂攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27504 2026-08-31 cs.CR 新提交 75%

Circuit Discovery Helps Detect LLM Jailbreaking: A Mechanistic Interpretability Study

电路发现助力检测大语言模型越狱:一项机制可解释性研究

Paria Mehrbod, Boris Knyazev, Guy Wolf, Eugene Belilovsky, Geraldin Nanfack

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract)

AI总结 本研究通过机制可解释性分析,在LLaMA-2-7B-chat-hf中识别出负责越狱响应的关键计算电路,剪枝这些电路可降低80%攻击成功率,为对齐LLMs的防御提供了可解释的新方向。

Comments Accepted at the 2nd Workshop on Reliable and Responsible Foundation Models of the 42nd International Conference on Machine Learning (ICML) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28394 2026-08-31 cs.CR cs.CL 新提交 57%

BEACON: Behavior-Anchored Cross-Source Knowledge Graph Construction for Cyber Threat Intelligence

BEACON:面向网络威胁情报的行为锚定跨源知识图谱构建

Changze Li, Yutong Cheng, Tsania Camila Finnisa, Qian Cui, Wei Ding, Peng Gao

专题命中 越狱攻击 :alignment(abstract);分类 cs.CL

AI总结 该研究提出BEACON框架,基于LLM结合MITRE ATT&CK实现跨源CTI知识图谱构建,构建了两个标注数据集,性能优于基线方法至少9%至23%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27658 2026-08-31 cs.CL 新提交 57%

When Tokenizers Fail: Byte-Level Chunking for Zero-Shot Transfer to Low-Resource Languages

当分词器失效:面向低资源语言零样本迁移的字节级分块方法

Sanjeev Kumar, Atsuki Yamaguchi, Nikolaos Aletras

机构 * IIT Bombay(印度理工学院孟买分校) University of Sheffield(谢菲尔德大学)

专题命中 越狱攻击 :alignment(abstract);分类 cs.CL

AI总结 本文针对低资源语言处理中字节级模型的粒度不匹配问题,提出适配的分层网络框架,通过初始化字节嵌入、分块对齐损失及词性监督,在六种语言的词性标注任务上实现最高13.3%的性能提升。

Comments Accepted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27531 2026-08-31 cs.CR cs.CV 新提交 50%

Fully Unleashing the Multimodal Attacker: Meta-Adaptive Jailbreaking of Vision-Language Models

充分释放多模态攻击者的潜力:视觉语言模型的元自适应越狱攻击

Benlei Cui, Shen Pang, Yuke Wang, Xuemei Dong, Yuwen Zhai, Jingqun Tang, Haiyang Yu, Hui Xue, Longtao Huang, Haiwen Hong

专题命中 越狱攻击 :safety(abstract)

AI总结 提出元自适应多模态越狱攻击(MAMJ),通过优化攻击策略提示与攻击者权重提升多模态越狱效果,在MM-SafetyBench上对多款前沿VLMs的攻击成功率显著优于基线,且可迁移至未见过的目标模型。

Comments Accepted by EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 红队测试 1 篇

2608.27141 2026-08-31 cs.CR cs.AI 版本更新 79%

Safety Does Not Compose: Non-Decaying Loop State for Autonomous LLM Agents

安全性无法组合:自主大型语言模型智能体的非衰减循环状态

Chenhao Wu, Haoxuan Jia, Yang Liu, Yingguang Yang, Yuhan Lin, Chongyang Zhang, Hao Zheng, Yulin Huang, Jianshen Zhang, Yongzhi Qi, Shang Luo, Kefu Xu, Jifeng Zhu, Bin Chong

机构 * University of Chinese Academy of Sciences(中国科学院大学) Nanyang Technological University(南洋理工大学) Supply Chain Tech Team Y, JD.com(京东Y供应链技术团队) Peking University(北京大学) Fudan University(复旦大学) Fullive-AI(Fullive人工智能)

专题命中 红队测试 :safety(title,abstract);分类 cs.AI

AI总结 该研究发现自主LLM智能体的轨迹级安全保障存在组合性缺陷,提出非衰减循环安全状态的LoopHarness方案,可限制未授权不可逆操作数量,通过Agent-SafetyBench等评估验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 提示注入 4 篇

2608.23873 2026-08-31 cs.AI cs.CL cs.CR cs.LG 版本更新 82%

Semantic Overlays: Mitigating Prompt Injection with Annotations Beyond Tokens and Steering Vectors

语义覆盖层:通过超越 token 和引导向量的注释缓解提示注入攻击

Joshua Penman

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究提出 Semantic Overlays 技术,通过在冻结语言模型残差流上应用小型学习适配器构建带外注释通道,有效缓解提示注入攻击,在多个基准测试中大幅降低攻击成功率且保持模型效用。

Comments 21 pages, 4 figures, 13 tables. Interactive demo: this https URL (https://semantic-overlays.vercel.app). Code and released adapters: this https URL (https://github.com/JoshuaSP/semantic-overlays)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28411 2026-08-31 cs.CR cs.AI 新提交 79%

LongPIBench: A Long-Context Benchmark for Prompt Injection

LongPIBench:用于提示注入的长上下文基准

Yupei Liu, Yuqi Jia, Neil Zhenqiang Gong, Jinyuan Jia

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.AI

AI总结 研究人员推出涵盖4类场景的长上下文基准LongPIBench,发现现有提示注入防御在长上下文下漏洞显著,简单攻击即可绕过,该基准可用于系统评估此类防御。

Comments To appear in Findings of EMNLP'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27496 2026-08-31 cs.CR 新提交 78%

ROPE: Routed Origin Policy Enforcement against Indirect Prompt Injection

ROPE:针对间接提示注入的路由来源策略执行

Xinhang Ma, Chaowei Xiao, William Yeoh, Ning Zhang, Yevgeniy Vorobeychik

专题命中 提示注入 :prompt injection(title,abstract)

AI总结 本文提出ROPE防御间接提示注入,通过确定性来源检查实现可证明的安全保证,在低攻击成功率的同时保留高智能体效用,优于现有系统级防御。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27990 2026-08-31 cs.CR cs.AI 新提交 57%

CAITLYN: Can LLM Agents Autonomously Synthesize Defenses against Emerging Injection Attacks?

CAITLYN:大语言模型智能体能否自主合成针对新型注入攻击的防御措施?

Zi Liang, Xiaoyu Xu, Yanyun Wang, Minxin Du, Qingqing Ye, Haibo Hu

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 针对LLM智能体注入攻击防御的三难困境,提出智能体无关防御中间件CAITLYN,其含即时防御与自主合成新防御的双系统,在标准基准与新基准Emerging上均表现优异,可降低攻击成功率。

Comments Source code: this https URL (https://github.com/liangzid/caitlyn)

详情

展开后加载摘要…

URL PDF HTML 收藏