PIPA: Preference Alignment as Prior-Informed Statistical Estimation
机构 * The University of Texas at Austin, US(德克萨斯大学奥斯汀分校)
专题命中 偏好对齐 :alignment(title,abstract);DPO(abstract);分类 cs.AI、cs.LG
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
机构 * The University of Texas at Austin, US(德克萨斯大学奥斯汀分校)
专题命中 偏好对齐 :alignment(title,abstract);DPO(abstract);分类 cs.AI、cs.LG
机构 * Aalto University(阿alto大学) ; ETH Zürich(苏黎世联邦理工学院) ; KTH Royal Institute of Technology(皇家理工学院)
专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);分类 cs.AI