arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-12-18 至 2025-12-18 共收录 1 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 红队测试 1 篇

2512.14745 2025-12-18 cs.CR cs.AI 57%

Factor(U,T): Controlling Untrusted AI by Monitoring their Plans

Factor(U,T): 通过监控其计划来控制不可信的AI

Edward Lue Chee Lip, Anthony Channg, Diana Kim, Aaron Sandoval, Kevin Zhu

专题命中 红队测试 :safety(abstract);分类 cs.AI

AI总结 Factor(U,T)通过监控AI分解计划来控制不可信AI,实验表明在仅观察自然语言指令时,监控恶意活动效果有限,而结合子任务监控则能实现高区分度和安全性。

Comments Accepted to AAAI 2026 Workshop on Trust and Control in Agentic AI (TrustAgent). 6 pages body, 8 pages total, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏