HumorReject: Decoupling LLM Safety from Refusal Prefix via A Little Humor
专题命中 安全训练 :safety(title,abstract);alignment(abstract);分类 cs.LG
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
专题命中 安全训练 :safety(title,abstract);alignment(abstract);分类 cs.LG
机构 * Alibaba.com US E-Commerce(阿里巴巴美国电子商务) ; Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))
专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.CY
机构 * University of California(加州大学) ; California Institute of Technology(加州理工学院) ; Abiomed(阿比omed)
专题命中 安全训练 :safety(abstract);分类 cs.LG
机构 * University of Bath(巴斯大学)
专题命中 安全训练 :safety(abstract);分类 cs.LG
Comments Camera-ready version. Published at the Conference on Neural Information Processing Systems (NeurIPS 2025)
Journal ref Proceedings of the Conference on Neural Information Processing Systems (NeurIPS 2025)
机构 * University of Science and Technology of China(科学技术大学)
专题命中 安全训练 :safety(abstract);分类 cs.CL
机构 * University of California, Berkeley(加州大学伯克利分校) ; Columbia University(哥伦比亚大学) ; Johns Hopkins University(约翰霍普金斯大学)
专题命中 安全训练 :alignment(comments,journal_ref);分类 cs.AI、cs.LG
Comments Accepted by ICML 2025 Workshop on Models of Human Feedback for AI Alignment
Journal ref ICML 2025 Workshop on Models of Human Feedback for AI Alignment