Cost-Minimized Label-Flipping Poisoning Attack to LLM Alignment
专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);DPO(abstract);分类 cs.AI、cs.LG
Comments accepted for AAAI 2026 Special Track on AI Alignment
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);DPO(abstract);分类 cs.AI、cs.LG
Comments accepted for AAAI 2026 Special Track on AI Alignment
机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室)
专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);DPO(abstract);分类 cs.CL
Journal ref 13th International Conference on Learning Representations (ICLR 2025)
专题命中 偏好对齐 :alignment(title,abstract);DPO(abstract);safety(abstract)
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; NewsBreak
专题命中 偏好对齐 :trustworthy(title);safety(abstract);分类 cs.CL
Comments Preprint update
专题命中 偏好对齐 :DPO(abstract);分类 cs.CL、cs.AI
Comments accepted to EMNLP2025
机构 * LinkedIn Corporation(LinkedIn公司) ; University of California San Diego(加州大学圣地亚哥分校)
专题命中 偏好对齐 :alignment(abstract);分类 cs.AI、cs.LG
专题命中 偏好对齐 :alignment(abstract);分类 cs.CL