arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-12-16 至 2025-12-16 共收录 9 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 9 篇

2508.16325 2025-12-16 cs.CL cs.AI cs.SC 90%

ConceptGuard: Neuro-Symbolic Safety Guardrails via Sparse Interpretable Jailbreak Concepts

ConceptGuard: 通过稀疏可解释的禁用概念实现神经符号安全防护

Darpan Aswal, Céline Hudelot

机构 * Department of Computer Science, Université Paris-Saclay(巴黎萨克雷大学计算机科学系) MICS, CentraleSupélec, Université Paris-Saclay(巴黎萨克雷大学MICS)

专题命中 越狱攻击 :safety(title,abstract);jailbreak(title,abstract);alignment(abstract);分类 cs.CL、cs.AI

AI总结 ConceptGuard通过稀疏自编码器识别可解释概念,构建可解释且可推广的安全防护,提升LLM对抗禁用攻击的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12921 2025-12-16 cs.CR cs.AI 85%

Cisco Integrated AI Security and Safety Framework Report

思科集成AI安全与安全框架报告

Amy Chang, Tiffany Saade, Sanket Mendapara, Adam Swanda, Ankit Garg

机构 * Cisco AI Threat and Security Research(思科人工智能威胁与安全研究)

专题命中 越狱攻击 :safety(title,abstract);prompt injection(abstract);AI safety(abstract);分类 cs.AI

AI总结 本文提出思科集成AI安全与安全框架,旨在统一分类和操作化AI风险,涵盖安全与安全,适用于威胁识别、风险优先级排序等,具有全面性和扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09321 2025-12-16 cs.CR 78%

ObliInjection: Order-Oblivious Prompt Injection Attack to LLM Agents with Multi-source Data

ObliInjection: 面向多源数据LLM代理的顺序无关提示注入攻击

Reachal Wang, Yuqi Jia, Neil Zhenqiang Gong

专题命中 越狱攻击 :prompt injection(title,abstract)

AI总结 ObliInjection是一种针对多源数据LLM代理的新型提示注入攻击,通过顺序无关损失和顺序GCG算法有效污染输入数据以误导模型执行攻击者指定任务。

Comments To appear in NDSS 2026. For slides, see https://people.duke.edu/~zg70/code/PromptInjection.pdf

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16689 2025-12-16 cs.CL cs.AI 62%

Concept-Based Interpretability for Toxicity Detection

基于概念的可解释性用于毒性检测

Samarth Garg, Divya Singh, Deeksha Varshney, Mamta

机构 * ABV–IIITM(ABV-IIITM) IIT Patna(印度帕纳大学) IIT Jodhpur(印度朱道普尔大学)

专题命中 越狱攻击 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出基于概念梯度的方法,通过分析有毒语言的归因机制,改进毒性检测的可解释性和准确性。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17904 2025-12-16 cs.CR cs.AI cs.CL 62%

BreakFun: Jailbreaking LLMs via Schema Exploitation

BreakFun: 通过模式利用对LLM进行劫持

Amirkia Rafiei Oskooei, Mehmet S. Aktas

机构 * Department of Computer Engineering, Yildiz Technical University(计算机工程系,伊兹密尔技术大学)

专题命中 越狱攻击 :jailbreak(abstract);分类 cs.CL、cs.AI

AI总结 BreakFun通过利用LLM对结构模式的遵守能力,揭示了其在劫持攻击中的脆弱性,并提出对抗性提示解构作为缓解策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11986 2025-12-16 cs.LG 57%

Learning to Extract Context for Context-Aware LLM Inference

学习提取上下文以实现上下文感知的LLM推理

Minseon Kim, Lucas Caccia, Zhengyan Shi, Matheus Pereira, Marc-Alexandre Côté, Xingdi Yuan, Alessandro Sordoni

机构 * Microsoft Research(微软研究院)

专题命中 越狱攻击 :safety(abstract);分类 cs.LG

AI总结 本文提出通过提取上下文信息提升LLM推理的安全性,减少有害输出并提高合规性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23453 2025-12-16 cs.CR cs.CL 57%

Counterfactual Evaluation for Blind Attack Detection in LLM-based Evaluation Systems

对抗性评估用于基于大语言模型的评估系统的盲攻击检测

Lijia Liu, Takumi Kondo, Kyohei Atarashi, Koh Takeuchi, Jiyi Li, Shigeru Saito, Hisashi Kashima

机构 * Kyoto University(京都大学) Hokkaido University(北海道大学) SIGNATE, Inc.(SIGNATE公司)

专题命中 越狱攻击 :prompt injection(abstract);分类 cs.CL

AI总结 本文提出SE+CFE框架,通过反事实评估提升基于大语言模型的评估系统对盲攻击的检测能力,同时保持性能稳定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17248 2025-12-16 cs.LG cs.CR 57%

Backdoors in DRL: Four Environments Focusing on In-distribution Triggers

DRL中的后门:聚焦于分布内触发器的四个环境

Chace Ashcraft, Ted Staley, Josh Carney, Cameron Hickert, Derek Juba, Kiran Karra, Nathan Drenkow

专题命中 越狱攻击 :safety(abstract);分类 cs.LG

AI总结 本文针对深度强化学习中的后门攻击,通过四个环境探讨分布内触发器的特性与影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19312 2025-12-16 cs.HC 50%

Human-AI Teaming Under Deception: An Implicit BCI Safeguards Drone Team Performance in Virtual Reality

人类与人工智能协同工作中的欺骗:一种隐式脑机接口保护虚拟现实中的无人机团队性能

Christopher Baker, Stephen Hinton, Akashdeep Nijjar, Riccardo Poli, Caterina Cinel, Tom Reed, Stephen Fairclough

专题命中 越狱攻击 :safety(abstract)

AI总结 隐式脑机接口通过解耦神经信号与行为,提升虚拟现实无人机团队在AI欺骗下的鲁棒性与安全性。

Comments 30 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏