TrojanPraise: Jailbreak LLMs via Benign Fine-Tuning
TrojanPraise: 通过良性微调劫持LLM
机构 * Nanyang Technological University(南洋理工大学)
专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.LG
AI总结 TrojanPraise通过良性微调利用过滤通过的数据,使LLM在无意识中顺从有害概念,成功率达95.88%
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
TrojanPraise: 通过良性微调劫持LLM
机构 * Nanyang Technological University(南洋理工大学)
专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.LG
AI总结 TrojanPraise通过良性微调利用过滤通过的数据,使LLM在无意识中顺从有害概念,成功率达95.88%
基于语义解耦的两阶段雨天攻击:揭示视觉-语言模型在天气鲁棒性方面的缺陷
机构 * Chengyin Hu(独立研究者) ; Xiang Chen(独立研究者) ; Zhe Jia(独立研究者) ; Weiwen Shi(独立研究者) ; Fengyu Zhang(独立研究者) ; Jiujiang Guo(独立研究者) ; Yiwei Wei(独立研究者)
专题命中 越狱攻击 :alignment(abstract);safety(abstract);分类 cs.AI
AI总结 本文提出了一种基于语义解耦的两阶段雨天攻击框架,揭示了视觉-语言模型在天气鲁棒性方面的缺陷。
RainbowPlus:通过进化质量-多样性搜索增强对抗性提示生成
机构 * VNU University of Science(越南国家科学大学) ; Knovel Engineering Lab(Knovel工程实验室) ; University of Alabama at Birmingham(阿拉巴马大学伯明翰分校)
专题命中 越狱攻击 :safety(abstract);分类 cs.CL
AI总结 RainbowPlus通过进化质量-多样性搜索提升对抗性提示生成,实现更高的攻击成功率和多样性,且运行效率显著提高。