UpSafe$^\circ$C: Upcycling for Controllable Safety in Large Language Models
专题命中 安全训练 :safety(title,abstract);alignment(abstract);jailbreak(abstract);分类 cs.AI、cs.LG
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
专题命中 安全训练 :safety(title,abstract);alignment(abstract);jailbreak(abstract);分类 cs.AI、cs.LG
机构 * DATA Consortium and FARAD Program, Kansas State University, Olathe, KS, USA(1DATA Consortium和FARAD计划,堪萨斯州立大学) ; Department of Computer Science, Kansas State University, Manhattan, KS, USA(计算机科学系,堪萨斯州立大学) ; Department of Statistics, Kansas State University, Manhattan, KS, USA(统计学系,堪萨斯州立大学) ; Department of Mathematics, Kansas State University, Olathe, KS, USA(数学系,堪萨斯州立大学)
专题命中 安全训练 :safety(title,abstract);分类 cs.AI、cs.LG
专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI
Comments 27 pages, 1 figure
机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) ; New York University(纽约大学)
专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.LG
Comments To be published at COLM, 2025
机构 * University of Toronto(多伦多大学) ; Qatar Computing Research Institute(卡塔尔计算研究院) ; Daffodil International University(达芙妮国际大学) ; Macquarie University(麦考瑞大学)
专题命中 安全训练 :safety(abstract);分类 cs.CL
机构 * GigaAI ; CASIA ; Tsinghua University(清华大学)
专题命中 安全训练 :alignment(abstract)