GuardNet: Graph-Attention Filtering for Jailbreak Defense in Large Language Models
机构 * Imperial College London(伦敦帝国理工学院)
专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.LG
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
机构 * Imperial College London(伦敦帝国理工学院)
专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.LG
专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.AI
机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, CAS(人工智能安全国家重点实验室,计算技术研究所,中国科学院) ; School of Computer Science & Technology, Beijing Institute of Technology(计算机科学与技术学院,北京理工大学)
专题命中 越狱攻击 :safety(title,abstract);jailbreak(abstract);分类 cs.AI、cs.LG
Comments Camera-ready version of EMNLP 2025 main conference. Code: https://github.com/k-k1w-w1x-x/Speculative-Safety-Aware-Decoding
机构 * The University of Hong Kong(香港大学)
专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.AI
机构 * Beijing Institute of Technology(北京理工大学) ; Hefei University of Technology(合肥工业大学) ; The University of Auckland(奥克兰大学)
专题命中 越狱攻击 :alignment(abstract);jailbreak(abstract);分类 cs.AI
机构 * University of Padova(帕多瓦大学) ; Stanford University(斯坦福大学) ; Carnegie Mellon University(卡内基梅隆大学) ; University of Pennsylvania(宾夕法尼亚大学) ; Örebro University(奥雷布罗大学) ; NVIDIA Research(NVIDIA研究)
专题命中 越狱攻击 :safety(abstract);jailbreak(abstract)
Comments Project page: https://j-dapt.github.io/. 9 pages, 6 figures
机构 * The Chinese University of Hong Kong, Shenzhen (CUHK-Shenzhen)(香港中文大学(深圳)) ; Baidu Inc.(百度公司)
专题命中 越狱攻击 :safety(abstract);分类 cs.CL、cs.AI
专题命中 越狱攻击 :jailbreak(abstract);分类 cs.LG
机构 * Fudan University(复旦大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
专题命中 越狱攻击 :safety(abstract)
Comments ICCV 2025