Trust in LLM-controlled Robotics: a Survey of Security Threats, Defenses and Challenges
对LLM控制的机器人信任:安全威胁、防御和挑战的综述
Xinyu Huang, Shyam Karthick V B, Taozhao Chen, Mitch Bryson, Thomas Chaffey, Huaming Chen, Kim-Kwang Raymond Choo, Ian R. Manchester
机构
*
School of Electrical and Computer Engineering, The University of Sydney(悉尼大学电气与计算机工程学院)
;
Australian Centre for Robotics and School of Aerospace, Mechanical and Mechatronic Engineering, The University of Sydney(悉尼大学机器人中心及航空航天、机械与机电工程学院)
;
Department of Information Systems and Cybersecurity, University of Texas at San Antonio(德克萨斯大学圣安东尼奥分校信息系统与网络安全系)
;
School of Engineering and Natural Sciences, University of Iceland(冰岛大学工程与自然科学学院)
机构
*
University of Science and Technology of China(中国科学技术大学)
;
The Hong Kong Polytechnic University(香港理工大学)
;
University of Washington(华盛顿大学)
;
Nanjing University(南京大学)
;
Stanford University(斯坦福大学)
;
University of Chinese Academy of Sciences(中国科学院大学)
机构
*
Guangzhou University(广州大学)
;
Shanghai Jiao Tong University(上海交通大学)
;
Australian Institute for Machine Learning, The University of Adelaide(澳大利亚机器学习研究所,阿德莱德大学)
Jailbreaking LLMs' Safeguard with Universal Magic Words for Text Embedding Models
Haoyu Liang, Youran Sun, Yunfeng Cai, Jun Zhu, Bo Zhang
机构
*
Dept. of Comp. Sci. and Tech., Inst. for AI, Tsinghua-Bosch Joint ML Center, THBI Lab, BNRist Center, Tsinghua University, Beijing, 100084, China(计算机科学与技术系、人工智能研究所、清华-博世联合机器学习中心、THBI实验室、BNRist中心、清华大学、北京)
;
Department of Mathematical Sciences, Tsinghua University(数学科学系、清华大学)
;
BIMSA, Beijing, China(BIMSA、北京、中国)
Rainbow Teaming: Open-Ended Generation of Diverse Adversarial Prompts
Mikayel Samvelyan, Sharath Chandra Raparthy, Andrei Lupu, Eric Hambro, Aram H. Markosyan, Manish Bhatt, Yuning Mao, Minqi Jiang, Jack Parker-Holder, Jakob Foerster, Tim Rocktäschel, Roberta Raileanu