The Policy Cliff: A Theoretical Analysis of Reward-Policy Maps in Large Language Models
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
专题命中 安全训练 :alignment(abstract);RLHF(abstract);safety(abstract);trustworthy(abstract)
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
专题命中 安全训练 :alignment(abstract);RLHF(abstract);safety(abstract);trustworthy(abstract)
机构 * Colorado State University, USA(科罗拉多州立大学) ; University of York, UK(约克大学) ; Carnegie Mellon University, USA(卡内基梅隆大学)
专题命中 安全训练 :safety(title,abstract);分类 cs.AI、cs.LG
Comments 32 pages; Equal contribution by W. Scarbro and C. Imrie; Accepted at 25th International Conference on Runtime Verification, 2025 (RV25)
专题命中 安全训练 :safety(title,abstract)
Comments 8 pages, 1 figure, 1 table, to be published in 2025 IEEE International Automated Vehicle Validation Conference (IAVVC)
专题命中 安全训练 :safety(abstract);分类 cs.CL