ProSocialAlign: Preference Conditioned Test Time Alignment in Language Models
ProSocialAlign:语言模型中的偏好条件测试时间对齐
机构 * Cisco Research(思科研究) ; Indian Institute of Technology Kharagpur(印度理工学院卡里格普尔分校) ; Eindhoven University of Technology, Netherlands (TU/e)(埃因霍温理工大学(荷兰))
专题命中 偏好对齐 :alignment(title,abstract);safety(abstract);分类 cs.CL
AI总结 ProSocialAlign通过测试时间参数高效方法,在不重新训练模型的情况下,引导生成安全、富有同理心且价值观一致的响应,提升语言模型的安全性和对齐性。