Constrained Language Model Policy Optimization via Risk-aware Stepwise Alignment
通过风险感知的逐步对齐实现约束语言模型策略优化
机构 * Key Laboratory of Computational Intelligence and Chinese Information Processing of Ministry of Education, School of Computer and Information Technology, Shanxi University(教育部计算智能与中文信息处理重点实验室,计算机与信息技术学院,山西大学) ; University College London(伦敦大学学院) ; Institute for AI, Peking University(北京大学人工智能研究院)
专题命中 安全训练 :alignment(title,abstract);RLHF(abstract);safety(abstract);分类 cs.AI
AI总结 本文提出风险感知的逐步对齐方法,通过嵌套风险度量提升语言模型策略优化的安全性与鲁棒性,有效抑制高影响有害行为。