arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-01-27 至 2026-01-27 共收录 1 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 红队测试 1 篇

2601.18076 2026-01-27 cs.LG 83%

Comparison requires valid measurement: Rethinking attack success rate comparisons in AI red teaming

比较需要有效的测量:重新思考AI红队中的攻击成功率比较

Alexandra Chouldechova, A. Feder Cooper, Solon Barocas, Abhinav Palia, Dan Vann, Hanna Wallach

机构 * Microsoft Research(微软研究院)

专题命中 红队测试 :red teaming(title,abstract);safety(abstract);分类 cs.LG

AI总结 本文重新审视AI红队中攻击成功率的比较,指出其有效性问题并提出测量理论和统计学方法以评估比较的合理性。

Journal ref NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏