from Benign import Toxic: Jailbreaking the Language Model via Adversarial Metaphors
从无害到有害:通过对抗隐喻 jailbreak 语言模型
Yu Yan, Sheng Sun, Zenghao Duan, Teli Liu, Min Liu, Zhiyi Yin, Jingyu Lei, Qi Li
机构
*
Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)
;
University of Chinese Academy of Sciences(中国科学院大学)
;
People’s Public Security University of China(中国人民公安大学)
;
Tsinghua University(清华大学)
专题命中
其他LLM
:language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL、cs.AI
The Devil Behind Moltbook: Anthropic Safety is Always Vanishing in Self-Evolving AI Societies
Moltbook背后的魔鬼:在自我进化的AI社会中,人类安全始终在消失
Chenxu Wang, Chaozhuo Li, Songyang Liu, Zejian Chen, Jinyu Hou, Ji Qi, Rui Li, Litian Zhang, Qiwei Ye, Zheng Liu, Xu Chen, Xi Zhang, Philip S. Yu
机构
*
Beijing University of Posts and Telecommunications(北京邮电大学)
;
Beijing Academy of Artificial Intelligence(北京人工智能研究院)
;
Renmin University of China(中国人民大学)
;
University of Illinois at Chicago(伊利诺伊大学香槟分校)
专题命中
其他LLM
:large language model(abstract);language model(abstract);分类 cs.CL
A Conditional Companion: Lived Experiences of People with Mental Health Disorders Using LLMs
基于条件的伴侣:使用LLMs的人的精神健康障碍者的亲身经历
Aditya Kumar Purohit, Hendrik Heuer
机构
*
Center for Advanced Internet Studies Bochum Germany
;
Center for Advanced Internet Studies \& University of Wuppertal Bochum Germany
;
Center for Advanced Internet Studies
;
Center for Advanced Internet Studies \& University of Wuppertal
专题命中
其他LLM
:large language model(abstract);language model(abstract);分类 cs.AI