Medical Malice: A Dataset for Context-Aware Safety in Healthcare LLMs
医疗恶意:用于医疗LLM中情境感知安全的数据库
专题命中 越狱攻击 :safety(title,abstract);alignment(abstract);分类 cs.CL、cs.AI、cs.CY
AI总结 Medical Malice提出一个情境感知安全的医疗数据库,通过对抗性提示和伦理推理提升医疗LLM的安全性,以应对医疗领域复杂且系统性的威胁。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
医疗恶意:用于医疗LLM中情境感知安全的数据库
专题命中 越狱攻击 :safety(title,abstract);alignment(abstract);分类 cs.CL、cs.AI、cs.CY
AI总结 Medical Malice提出一个情境感知安全的医疗数据库,通过对抗性提示和伦理推理提升医疗LLM的安全性,以应对医疗领域复杂且系统性的威胁。
主动防御:用于检测说服攻击并衡量免疫效果的复合AI
机构 * Aptima, Inc.(Aptima公司)
专题命中 越狱攻击 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI
AI总结 本文提出BRIES复合AI架构,通过专门代理检测说服攻击并评估免疫效果,揭示不同模型在处理说服语言上的差异。
LLM安全逻辑的可蒸馏性:通过排序回归预测轮廓填充攻击的成功率
专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.AI
AI总结 本文通过排序回归方法,研究LLM安全逻辑的可蒸馏性,提出改进的轮廓填充攻击以预测攻击成功率,实验表明代理模型在预测安全边界方面具有较高准确性。