EASE: Practical and Efficient Safety Alignment for Small Language Models
专题命中 越狱攻击 :alignment(title,abstract);safety(title,abstract);jailbreak(abstract);分类 cs.LG
Comments Accepted to AAAI 2026
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
专题命中 越狱攻击 :alignment(title,abstract);safety(title,abstract);jailbreak(abstract);分类 cs.LG
Comments Accepted to AAAI 2026
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Brown University(布朗大学) ; University of Michigan Ann Arbor(密歇根大学安娜堡分校) ; Hong Kong University of Science and Technology(香港科学与技术大学) ; Carnegie Mellon University(卡内基梅隆大学) ; Boise State University(博伊西州立大学)
专题命中 越狱攻击 :alignment(abstract);jailbreak(abstract);分类 cs.CL、cs.LG
Comments 45 pages
机构 * Department of Computer Science(计算机科学系) ; Tennessee Tech University(田纳西科技大学) ; School of Interdisciplinary Informatics(跨学科信息学学院) ; University of Nebraska Omaha(内布拉斯加大学奥马哈分校)
专题命中 越狱攻击 :prompt injection(abstract);分类 cs.AI
专题命中 越狱攻击 :jailbreak(abstract)