arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-12-01 至 2025-12-01 共收录 3 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 3 篇

2511.21757 2025-12-01 cs.CY cs.AI cs.CL cs.CR 85%

Medical Malice: A Dataset for Context-Aware Safety in Healthcare LLMs

医疗恶意:用于医疗LLM中情境感知安全的数据库

Andrew Maranhão Ventura D'addario

专题命中 越狱攻击 :safety(title,abstract);alignment(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 Medical Malice提出一个情境感知安全的医疗数据库,通过对抗性提示和伦理推理提升医疗LLM的安全性,以应对医疗领域复杂且系统性的威胁。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21749 2025-12-01 cs.CL cs.AI 73%

Proactive Defense: Compound AI for Detecting Persuasion Attacks and Measuring Inoculation Effectiveness

主动防御:用于检测说服攻击并衡量免疫效果的复合AI

Svitlana Volkova, Will Dupree, Hsien-Te Kao, Peter Bautista, Gabe Ganberg, Jeff Beaubien, Laura Cassani

机构 * Aptima, Inc.(Aptima公司)

专题命中 越狱攻击 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI

AI总结 本文提出BRIES复合AI架构,通过专门代理检测说服攻击并评估免疫效果,揭示不同模型在处理说服语言上的差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22044 2025-12-01 cs.CR cs.AI 70%

Distillability of LLM Security Logic: Predicting Attack Success Rate of Outline Filling Attack via Ranking Regression

LLM安全逻辑的可蒸馏性:通过排序回归预测轮廓填充攻击的成功率

Tianyu Zhang, Zihang Xi, Jingyu Hua, Sheng Zhong

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.AI

AI总结 本文通过排序回归方法,研究LLM安全逻辑的可蒸馏性,提出改进的轮廓填充攻击以预测攻击成功率,实验表明代理模型在预测安全边界方面具有较高准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏