ForgeDAN: An Evolutionary Framework for Jailbreaking Aligned Large Language Models
Siyang Cheng, Gaotian Liu, Rui Mei, Yilin Wang, Kejia Zhang, Kaishuo Wei, Yuqi Yu, Weiping Wen, Xiaojie Wu, Junhua Liu
机构
*
iFLYTEK Security Laboratory(iFLYTEK安全实验室)
;
Anhui SparkShield Intelligent Technology Co., Ltd.(安徽SparkShield智能科技有限公司)
;
Peking University(北京大学)
;
School of Automation, University of Electronic Science and Technology of China(电子科技大学自动化学院)
;
Northwest University(西北大学)
;
University of New South Wales(新南威尔士大学)
;
National Computer Network Emergency Response Technical Team/Coordination Center of China(中国国家计算机网络应急技术处置协调中心)
JailbreakZoo: Survey, Landscapes, and Horizons in Jailbreaking Large Language and Vision-Language Models
Haibo Jin, Leyang Hu, Xinnuo Li, Peiyan Zhang, Chonghan Chen, Jun Zhuang, Haohan Wang
机构
*
University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
;
Brown University(布朗大学)
;
University of Michigan Ann Arbor(密歇根大学安娜堡分校)
;
Hong Kong University of Science and Technology(香港科学与技术大学)
;
Carnegie Mellon University(卡内基梅隆大学)
;
Boise State University(博伊西州立大学)
Adaptive Defense against Harmful Fine-Tuning for Large Language Models via Bayesian Data Scheduler
Zixuan Hu, Li Shen, Zhenyi Wang, Yongxian Wei, Dacheng Tao
机构
*
Nanyang Technological University(南洋理工大学)
;
Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区)
;
University of Central Florida(佛罗里达大学)
;
Tsinghua University(清华大学)
MixAT: Combining Continuous and Discrete Adversarial Training for LLMs
Csaba Dékány, Stefan Balauca, Robin Staab, Dimitar I. Dimitrov, Martin Vechev
机构
*
INSAIT, Sofia University "St. Kliment Ohridski"(INSAIT,索菲亚大学"圣克莱孟·奥赫里迪斯基")
;
ETH Zurich(苏黎世联邦理工学院)
;
ELTE Eötvös Loránd University, Budapest, Hungary(ELTE 爱斯特霍特·洛兰德大学,布达佩斯,匈牙利)
Language Models Are Capable of Metacognitive Monitoring and Control of Their Internal Activations
Li Ji-An, Hua-Dong Xiong, Robert C. Wilson, Marcelo G. Mattar, Marcus K. Benna
机构
*
Neurosciences Graduate Program University of California San Diego(加州大学圣地亚哥分校神经科学研究生项目)
;
School of Psychology Georgia Tech(佐治亚理工学院心理学系)
;
Department of Psychology New York University(纽约大学心理学系)
;
Department of Neurobiology University of California San Diego(加州大学圣地亚哥分校神经生物学系)
AIPsychoBench: Understanding the Psychometric Differences between LLMs and Humans
Wei Xie, Shuoyoucheng Ma, Zhenhua Wang, Enze Wang, Kai Chen, Xiaobing Sun, Baosheng Wang
机构
*
College of Computer Science and Technology, National University of Defense Technology(国防科技大学计算机科学与技术学院)
;
Institute of High Performance Computing, Agency for Science, Technology and Research (A*STAR)(科学研究院高性能计算研究所)
;
Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所)
CommentsThank you for your attention. This paper was accepted by the CogSci 2025 conference in April and published in August. The location in the proceedings is: https://escholarship.org/uc/item/39k8f46q
机构
*
Key Laboratory of Big Data & Artificial Intelligence in Transportation (Beijing Jiaotong University), Ministry of Education(大数据与人工智能交通运输 key laboratory(北京交通大学))
;
School of Computer Science and Technology, Beijing Jiaotong University(计算机科学与技术学院(北京交通大学))
;
University of Montreal(蒙特利尔大学)
Fuzz-Testing Meets LLM-Based Agents: An Automated and Efficient Framework for Jailbreaking Text-To-Image Generation Models
Yingkai Dong, Xiangtao Meng, Ning Yu, Zheng Li, Shanqing Guo
机构
*
School of Cyber Science and Technology, Shandong University(山东大学网络科学与技术学院)
;
Netflix Eyeline Studios
;
State Key Laboratory of Cryptography and Digital Economy Security, Shandong University(山东大学密码与数字经济安全国家重点实验室)
;
Shandong Key Laboratory of Artificial Intelligence Security, Shandong University(山东省人工智能安全重点实验室)