Defending MoE LLMs against Harmful Fine-Tuning via Safety Routing Alignment
机构 * KAIST(韩国科学技术院)
专题命中 安全训练 :safety(title,abstract);alignment(title);分类 cs.AI
Comments Under review
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
机构 * KAIST(韩国科学技术院)
专题命中 安全训练 :safety(title,abstract);alignment(title);分类 cs.AI
Comments Under review
机构 * National Key R&D Program of China(中华人民共和国国家重点研发计划)
专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.AI
机构 * Max Studt 1 ; Georg Schildbach 1
专题命中 安全训练 :safety(abstract);分类 cs.AI
机构 * University of Texas at San Antonio(德克萨斯大学圣安东尼奥分校) ; Louisiana State University(路易斯安那州立大学) ; Cisco Research(思科研究)
专题命中 安全训练 :safety(abstract);分类 cs.CL
Comments 8 pages + Appendix
专题命中 安全训练 :safety(abstract)
Comments 13 pages to appear in Proceedings of ASE 2025