Causes and Consequences of Representational Similarity in Machine Learning Models
专题命中 越狱攻击 :jailbreak(abstract);分类 cs.LG
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
专题命中 越狱攻击 :jailbreak(abstract);分类 cs.LG
机构 * Zhejiang University(浙江大学) ; Huawei(华为)
专题命中 越狱攻击 :prompt injection(abstract);分类 cs.LG
机构 * Department of Computer Science, University of Arizona(亚利桑那大学计算机科学系) ; CRIL CNRS & University of Artois(CNRS CRIL与阿维尼昂大学)
专题命中 越狱攻击 :alignment(abstract);分类 cs.CL
Comments Accepted to EMNLP 2025 Findings
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Purdue University(普渡大学)
专题命中 越狱攻击 :jailbreak(abstract);分类 cs.CL
Comments Accepted to EMNLP 2025 (Main). 17 pages, 7 figures
机构 * Shanghai Key Lab of Intell. Info. Processing, School of CS, Fudan University(上海智能信息处理实验室,计算机科学学院,复旦大学) ; The Chinese University of Hong Kong, Shatin, Hong Kong(香港中文大学,沙田,香港) ; The University of Hong Kong, Pokfulam, Hong Kong(香港大学,薄扶林,香港)
专题命中 越狱攻击 :safety(abstract);分类 cs.AI
Comments This work has been submitted to the IEEE for possible publication
机构 * The University of Hong Kong(香港大学)
专题命中 越狱攻击 :alignment(abstract);分类 cs.AI
Comments This paper has been accepted by the ACM Conference on Computer and Communications Security (CCS) 2025
机构 * Hiroshima University(广岛大学)
专题命中 越狱攻击 :prompt injection(abstract);分类 cs.AI
专题命中 越狱攻击 :safety(abstract);分类 cs.AI
Comments This is the authors accepted manuscript of an article accepted for publication in Cluster Computing. The final published version is available at: 10.1007/s10586-025-05326-9
机构 * University of Waterloo(多伦多大学) ; University of California, Berkeley(加州大学伯克利分校) ; University of Toronto(多伦多大学)
专题命中 越狱攻击 :alignment(abstract);分类 cs.CL
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 越狱攻击 :alignment(abstract);分类 cs.CL
机构 * Shenzhen University(深圳大学) ; University of Nottingham Ningbo China(诺丁汉大学宁波分校) ; City University of Hong Kong(香港城市大学) ; Stanford University(斯坦福大学) ; Hong Kong University of Science and Technology(香港科学与技术大学)
专题命中 越狱攻击 :alignment(abstract);分类 cs.CL
Comments ICCV 2025, 38 pages, 22 figures, 35 tables
专题命中 越狱攻击 :alignment(abstract);分类 cs.CL
Comments 7 pages, 4 figures
专题命中 越狱攻击 :safety(abstract);分类 cs.AI
机构 * University of California, Davis(加州大学戴维斯分校) ; University of Hawaii at Mānoa(夏威夷大学马诺阿分校)
专题命中 越狱攻击 :trustworthy(abstract);分类 cs.CL
机构 * Pivotal Research(Pivotal研究机构) ; Stanford University(斯坦福大学)
专题命中 越狱攻击 :trustworthy(abstract);分类 cs.AI
Comments Abstract submitted to the Technical AI Governance Forum 2025 (https://www.techgov.ai/)
机构 * eBRAIN Lab, New York University Abu Dhabi (NYUAD), UAE(eBRAIN实验室,纽约大学阿布扎赫尔分校(NYUAD),阿联酋) ; AI and Digital Science Research Center, Technology Innovation Institute (TII), Abu Dhabi, UAE(人工智能与数字科学研究中心,技术创新研究所(TII),阿布扎赫尔,阿联酋)
专题命中 越狱攻击 :safety(abstract);分类 cs.LG
Comments 8 pages, 8 figures, 1 table
机构 * Department of Electrical Engineering(电气工程系) ; Indian Institute of Technology Delhi(印度理工学院德里)
专题命中 越狱攻击 :jailbreak(abstract);分类 cs.CL
机构 * Centre for Sustainable Development, University of Newcastle (Australia), Singapore(可持续发展中心,新南威尔士大学(澳大利亚),新加坡)
专题命中 越狱攻击 :safety(abstract);分类 cs.AI
Comments 8 Pages, 1 figure
专题命中 越狱攻击 :prompt injection(abstract);分类 cs.AI
机构 * Networked Systems Security (NSS) Group\ Royal Institute of Technology Stockholm Sweden ; Networked Systems Security (NSS) Group\ Royal Institute of Technology
专题命中 越狱攻击 :safety(abstract);分类 cs.AI
Comments Author's version; Accepted for presentation at the ACM Workshop on Wireless Security and Machine Learning (WiseML 2025)
机构 * Purdue University(普渡大学) ; Columbia University(哥伦比亚大学) ; Virginia Tech(弗吉尼亚理工大学)
专题命中 越狱攻击 :alignment(abstract);分类 cs.AI
机构 * SAIL Lab, University of New Haven, West Haven, CT, USA(SAIL实验室,新罕布什尔大学,西哈文,康涅狄格州,美国)
专题命中 越狱攻击 :safety(abstract);分类 cs.AI
机构 * Pennsylvania State University(宾夕法尼亚州立大学)
专题命中 越狱攻击 :trustworthy(abstract);分类 cs.LG
Comments 23 pages, 5 figures
机构 * princeton(普林斯顿大学)
专题命中 越狱攻击 :prompt injection(abstract);分类 cs.AI
Comments 10 pages, 6 figures
机构 * University of Science and Technology of China(中国科学技术大学) ; City University of Hong Kong(香港城市大学) ; Independent Researcher(独立研究者)
专题命中 越狱攻击 :safety(abstract);分类 cs.AI
机构 * Jilin University(吉林大学) ; Shanghai Jiao Tong University(上海交通大学) ; Nanyang Technological University(南洋理工大学) ; Northeastern University(东北大学)
专题命中 越狱攻击 :jailbreak(abstract);分类 cs.AI
专题命中 越狱攻击 :prompt injection(abstract);分类 cs.LG
机构 * AIRI ; MSU(莫斯科国立大学) ; HSE University(俄罗斯高等经济大学) ; Skoltech(斯克里普钦科技大学)
专题命中 越狱攻击 :alignment(abstract);分类 cs.AI
Comments Added benchmarks, baselines, author, appendix
机构 * Dept. of Software and Information Systems Engineering(软件与信息系统工程系) ; Ben-Gurion University of the Negev(贝叶尔-加利利大学)
专题命中 越狱攻击 :prompt injection(abstract);分类 cs.AI
专题命中 越狱攻击 :trustworthy(abstract);分类 cs.CY
Comments Submitted to CHI 2024
Journal ref Artificial Intelligence Review, 2024