arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-08-28 至 2025-08-28 共收录 1 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 红队测试 1 篇

2508.19461 2025-08-28 cs.AI cs.CR cs.LG 73%

Reliable Weak-to-Strong Monitoring of LLM Agents

Neil Kale, Chen Bo Calvin Zhang, Kevin Zhu, Ankit Aich, Paula Rodriguez, Scale Red Team, Christina Q. Knight, Zifan Wang

机构 * Scale AI Carnegie Mellon University(卡内基梅隆大学) Massachusetts Institute of Technology(麻省理工学院)

专题命中 红队测试 :red teaming(abstract);prompt injection(abstract);分类 cs.AI、cs.LG

Comments 18 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏