Query-Based Adversarial Prompt Generation
专题命中 越狱攻击 :safety(abstract);分类 cs.CL、cs.AI、cs.LG
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
专题命中 越狱攻击 :safety(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 越狱攻击 :jailbreak(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 越狱攻击 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG
Comments NeurIPS 2024 Spotlight; code available at https://github.com/lapisrocks/rpo
专题命中 越狱攻击 :jailbreak(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Accepted for presentation at NeurIPS 2024. Code: https://github.com/RICommunity/TAP
专题命中 越狱攻击 :jailbreak(abstract);分类 cs.CL、cs.AI、cs.LG
Comments NeurIPS 2024
专题命中 越狱攻击 :prompt injection(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 越狱攻击 :safety(abstract);分类 cs.CL、cs.AI、cs.LG
Comments 22 pages
专题命中 越狱攻击 :alignment(abstract);safety(abstract)
专题命中 越狱攻击 :safety(abstract);分类 cs.AI、cs.CY、cs.LG
Comments 10 pages, 6 figures
专题命中 越狱攻击 :alignment(abstract);safety(abstract)
专题命中 越狱攻击 :RLHF(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 越狱攻击 :safety(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 越狱攻击 :jailbreak(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 越狱攻击 :jailbreak(abstract);分类 cs.CL、cs.AI、cs.LG
Comments EMNLP 2023
专题命中 越狱攻击 :safety(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Equal contribution from first two authors. 19 pages, 5 figures. Our code is available at: https://github.com/Vaidehi99/InfoDeletionAttacks
专题命中 越狱攻击 :jailbreak(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Serious errors were found in the experiment, which may lead to the overturning of the overall conclusions of the paper
专题命中 越狱攻击 :jailbreak(abstract);分类 cs.CL、cs.AI、cs.CY
专题命中 越狱攻击 :safety(abstract);分类 cs.CL、cs.AI、cs.CY
强化学习迈向广泛且持久有益的模型
机构 * OpenAI
专题命中 越狱攻击 :alignment(abstract,comments);分类 cs.CL、cs.AI
AI总结 通过真实领域中的有益行为强化学习,模型在超过80%的分布外基准上表现提升,并展现出跨领域对齐泛化与对抗攻击的持久性。
Comments Blog: https://alignment.openai.com/beneficial-rl/
BadRobot: 在物理世界中越狱具身LLM智能体
机构 * Huazhong University of Science and Technology(华中科技大学) ; Beihang University(北航) ; Griffith University(格里菲斯大学)
专题命中 越狱攻击 :safety(abstract,comments);分类 cs.AI、cs.CY
AI总结 提出BadRobot攻击范式,利用LLM在机器人系统中的操纵、语言输出与物理动作的错位以及世界知识缺陷三个漏洞,通过语音交互使具身LLM执行有害行为,并在基准测试中验证了有效性。
Comments Accepted to ICLR 2025. Please cite the conference version. Project page: https://Embodied-LLMs-Safety.github.io
Journal ref International Conference on Learning Representations (ICLR) 2025
专题命中 越狱攻击 :alignment(abstract);分类 cs.CL、cs.AI;safety(comments)
Comments ML Safety Workshop NeurIPS 2022
相同载荷,不同通道:测量使用工具的語言模型中的信任不对称性
机构 * University of Arizona(亚利桑那大学)
专题命中 越狱攻击 :safety(abstract);分类 cs.CL、cs.LG
AI总结 本研究提出安全不对称分数(SAS),通过匹配恶意载荷仅改变传递上下文,系统测量了语言模型在不同通道(用户消息、工具元数据、工具输出)中对对抗性内容的脆弱性差异,发现代理原生模型在工具描述通道更脆弱,而通用模型相反,且机制研究表明安全相关表示在深层网络非线性编码。
Comments Accepted to EMNLP 2026 (Main Conference)
学习说服暴露了大语言模型(LLMs)放弃正确信念的难易程度
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 越狱攻击 :safety(abstract);分类 cs.CL、cs.AI
AI总结 研究发现优化后的对抗性说服策略可轻易让LLMs放弃正确信念,攻击成功率高且可迁移,凸显多智能体决策系统需将说服鲁棒性作为安全标准
通过非局部性测量SAE特征的语义抽象性
专题命中 越狱攻击 :jailbreak(abstract);分类 cs.AI、cs.LG
AI总结 该研究提出特征非局部性(FNL)指标,可区分SAE特征的抽象层级,用于审计越狱缓解特征及引导DeepSeek-R1模型特征提升数学推理准确率。
Comments 18 pages, 9 figures
基因型触发器:通过生成抗菌肽模型中宿主特定后门暴露药物基因组学盲区
专题命中 越狱攻击 :safety(abstract);分类 cs.CL、cs.AI
AI总结 该研究提出基因型触发器后门攻击,操控抗菌肽生成模型使其针对特定HLA等位基因携带者生成高免疫原性风险肽,同时保留抗菌效力与低毒性,以暴露药物基因组学盲区。
AI安全排行榜:方法、结果与最低标准
专题命中 越狱攻击 :jailbreak(abstract);分类 cs.CL、cs.AI
AI总结 本研究推出AI安全防护最低标准V1.0,测试Claude Fable5等四款模型的越狱鲁棒性,发现模型间防御能力差异大,部分模型未出现通用越狱,可通过现有技术缩小防御差距。
时序上下文感知:一种针对大型语言模型多轮操纵攻击的防御框架
专题命中 越狱攻击 :safety(abstract);分类 cs.AI、cs.LG
AI总结 针对LLMs易受多轮操纵攻击的问题,本文提出TCA框架,通过分析语义漂移等实现防御,初步评估显示其能识别传统方法遗漏的微妙操纵模式,为对话式AI系统提供安全保障。
Comments 6 pages, 2 figures, IEEE CAI
QShield: 通过量子电路安全神经网络对抗对抗性攻击
机构 * Emory University(埃默里大学)
专题命中 越狱攻击 :safety(abstract);分类 cs.AI、cs.LG
AI总结 QShield通过结合传统CNN和量子处理模块,提升经典深度学习模型的对抗鲁棒性,实验表明其在多种数据集上有效降低攻击成功率并提高预测准确性。
通过表示引导在视觉语言模型供应链中植入架构后门
专题命中 越狱攻击 :safety(abstract);分类 cs.AI、cs.LG
AI总结 研究视觉语言模型供应链安全问题,提出通过表示引导植入架构后门的攻击方法,该方法不影响训练数据等,通过触发控制模型表示转向攻击者目标,评估表明其损害模型多项性能,还提出审计防御方法。
Gubernaut:用于情感调节的大语言模型代理的确定性稳态控制器,在独立模型家族中得到验证
机构 * Gubernaut Research(Gubernaut研究)
专题命中 越狱攻击 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 研究针对大语言模型代理的故障模式,提出Gubernaut认知控制器,通过在四个前沿模型上预注册的评估协议验证,该控制器能使模型更平静,有恢复特征等机制,附带可重判记录及预注册故障模式。
Comments 26 pages, 7 figures, 3 tables. Data, transcripts, and analysis scripts: https://github.com/thegubernaut/Gubernaut_Validation Project page: https://gubernaut.com (archived at https://doi.org/10.5281/zenodo.21303518)