"To Survive, I Must Defect": Jailbreaking LLMs via the Game-Theory Scenarios
为生存,我必须背叛:通过博弈论场景进行大语言模型的劫持攻击
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) ; East China Normal University(华东师范大学) ; Flexera(Flexera公司) ; Zhejiang University(浙江大学) ; Xidian University(西安电子科技大学) ; Xi’an Jiaotong University(西安交通大学) ; Institute of Deep Perception Technology, JITRI(JITRI深度感知技术研究所)
AI总结 本文提出一种基于博弈论的可扩展黑盒劫持框架GTA,通过重塑LLM目标以提高攻击成功率,实现在多种场景下的高ASR表现。
Comments 20 pages