Configurable Reward Model for Balanced Safety Alignment
可配置奖励模型用于平衡安全对齐
机构 * Johns Hopkins University(约翰霍普金斯大学) ; Meta Superintelligence Labs(Meta超智能实验室)
专题命中 后训练与偏好优化 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 提出可配置安全奖励模型(CSRM),通过配置目标数据增强和联合优化,实现对细粒度安全配置和对话细微差别的敏感性,在可配置安全基准上达到最优性能,并改善有用性与安全性的权衡。