arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-01-29 至 2026-01-29 共收录 3 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 3 篇

2411.08862 2026-01-29 cs.LG cs.CR 70%

LLMStinger: Jailbreaking LLMs using RL fine-tuned LLMs

LLMStinger: 使用强化学习微调的LLM进行LLM劫持

Piyush Jha, Arnav Arora, Vijay Ganesh

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.LG

AI总结 LLMStinger通过强化学习微调LLM,生成对抗性后缀以提高对有害问题的攻击成功率,显著优于现有方法。

Comments Accepted at AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20184 2026-01-29 cs.CR cs.DC 67%

Securing AI Agents in Cyber-Physical Systems: A Survey of Environmental Interactions, Deepfake Threats, and Defenses

在物理信息系统中保障AI代理:环境交互、深度伪造威胁及防御的综述

Mohsen Hatami, Van Tuan Pham, Hozefa Lakadawala, Yu Chen

专题命中 越狱攻击 :safety(abstract);trustworthy(abstract)

AI总结 本文综述了物理信息系统中AI代理的安全威胁,重点分析了环境交互、深度伪造攻击及MCP漏洞,并提出基于SENTINEL框架的防御策略与挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19970 2026-01-29 cs.CR cs.LG 57%

Benchmarking LLAMA Model Security Against OWASP Top 10 For LLM Applications

根据OWASP Top 10为LLM应用程序的框架对LLAMA模型安全性能进行基准测试

Nourin Shahin, Izzat Alsmadi

机构 * Texas A&M University(德克萨斯A&M大学)

专题命中 越狱攻击 :safety(abstract);分类 cs.LG

AI总结 本研究通过对比不同LLama模型的安全性能,发现小型专用模型在威胁检测上表现优于大型通用模型,并提供开源数据集支持AI安全研究。

详情

展开后加载摘要…

URL PDF HTML 收藏