Reward Model Routing in Alignment
机构 * National University of Singapore(新加坡国立大学)
专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);分类 cs.AI
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
机构 * National University of Singapore(新加坡国立大学)
专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);分类 cs.AI
机构 * Bloomberg(高盛)
专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI
机构 * Oracle Health AI(Oracle健康AI)
专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI