LLMStinger: Jailbreaking LLMs using RL fine-tuned LLMs
LLMStinger: 使用强化学习微调的LLM进行LLM劫持
专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.LG
AI总结 LLMStinger通过强化学习微调LLM,生成对抗性后缀以提高对有害问题的攻击成功率,显著优于现有方法。
Comments Accepted at AAAI 2025
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
LLMStinger: 使用强化学习微调的LLM进行LLM劫持
专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.LG
AI总结 LLMStinger通过强化学习微调LLM,生成对抗性后缀以提高对有害问题的攻击成功率,显著优于现有方法。
Comments Accepted at AAAI 2025
在物理信息系统中保障AI代理:环境交互、深度伪造威胁及防御的综述
专题命中 越狱攻击 :safety(abstract);trustworthy(abstract)
AI总结 本文综述了物理信息系统中AI代理的安全威胁,重点分析了环境交互、深度伪造攻击及MCP漏洞,并提出基于SENTINEL框架的防御策略与挑战。
根据OWASP Top 10为LLM应用程序的框架对LLAMA模型安全性能进行基准测试
机构 * Texas A&M University(德克萨斯A&M大学)
专题命中 越狱攻击 :safety(abstract);分类 cs.LG
AI总结 本研究通过对比不同LLama模型的安全性能,发现小型专用模型在威胁检测上表现优于大型通用模型,并提供开源数据集支持AI安全研究。