Safety Training May Persist Through Helpfulness Optimization in LLM Agents
在LLM代理中通过帮助性优化保持安全性训练
机构 * Department of Computer Science, University of California, Berkeley, USA(计算机科学系,加州大学伯克利分校)
专题命中 后训练与偏好优化 :LLM(title,title_cn);post-training(abstract);preference optimization(abstract);分类 cs.CL、cs.LG
AI总结 研究通过帮助性优化在LLM代理中保持安全性训练,发现单独训练或依次训练无法找到最佳策略,但所有配置接近帕累托前沿。
Comments Preprint