SPA: Achieving Consensus in LLM Alignment via Self-Priority Optimization
机构 * University of Notre Dame(诺特大学)
专题命中 偏好对齐 :alignment(title,abstract);safety(abstract);harmlessness(abstract);trustworthy(abstract)
Comments Accepted by AAAI 2026 (Oral)
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
机构 * University of Notre Dame(诺特大学)
专题命中 偏好对齐 :alignment(title,abstract);safety(abstract);harmlessness(abstract);trustworthy(abstract)
Comments Accepted by AAAI 2026 (Oral)
机构 * Mila–Quebec AI Institute(魁北克AI研究所)
专题命中 偏好对齐 :alignment(title,abstract);DPO(abstract);safety(abstract);分类 cs.AI
Comments ICML 2025
机构 * Rensselaer Polytechnic Institute(罗切斯特理工学院) ; IBM Research(IBM研究院) ; Cornell University(康奈尔大学)
专题命中 偏好对齐 :RLHF(abstract);DPO(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 偏好对齐 :alignment(abstract);分类 cs.CL
专题命中 偏好对齐 :alignment(abstract);分类 cs.CL
Comments 13 pages, 1 figure