ENCORE: Entropy-guided Reward Composition for Multi-head Safety Reward Models
专题命中 偏好对齐 :safety(title,abstract);alignment(abstract);RLHF(abstract);分类 cs.CL
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
专题命中 偏好对齐 :safety(title,abstract);alignment(abstract);RLHF(abstract);分类 cs.CL
机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院) ; Beijing Key Laboratory of Research on Large Models and Intelligent Governance(北京大型模型与智能治理研究重点实验室) ; Engineering Research Center of Next-Generation Intelligent Search and Recommendation, MOE(下一代智能搜索与推荐工程技术研究中心,教育部) ; Kuaishou Technology(快手科技) ; University of Chinese Academy of Sciences(中国科学院大学)
专题命中 偏好对齐 :RLHF(title,abstract);alignment(abstract);分类 cs.AI、cs.LG
Comments Accepted to ACL 2025
机构 * Department of Data Science and AI, Monash University, Australia(墨尔本大学数据科学与人工智能系) ; eBay Inc.(eBay公司)
专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL
专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.CL、cs.AI、cs.CY
Comments 17 pages, 2 tables, Preprint - under review at AI & Society
机构 * Department of Computer Science(计算机科学系)
专题命中 偏好对齐 :alignment(abstract);DPO(abstract);分类 cs.CL、cs.AI
Comments Accepted at IJCNLP-AACL 2025 Findings
机构 * Google DeepMind(谷歌DeepMind)
专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI
Comments 15pages,11figures,AAAI-26
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Shanghai Key Laboratory of Data Science, School of Computer Science, Fudan University(上海数据科学关键实验室,计算机科学学院,复旦大学)
专题命中 偏好对齐 :alignment(abstract);分类 cs.AI、cs.LG
专题命中 偏好对齐 :alignment(abstract)
Comments 12 pages, 4 figures