X-Teaming: Multi-Turn Jailbreaks and Defenses with Adaptive Multi-Agents
专题命中 安全训练 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI、cs.LG
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
专题命中 安全训练 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI、cs.LG
机构 * Boise State University(博伊州立大学) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; University of Pittsburgh(匹兹堡大学) ; New York University(纽约大学) ; Florida International University(佛罗里达国际大学)
专题命中 安全训练 :safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI
Comments Accepted for EMNLP'25 Findings. TL;DR: We propose a new two-stage intent-based prompt-refinement framework, IntentPrompt, that aims to explore the vulnerability of LLMs' content moderation guardrails by refining prompts into benign-looking declarative forms via intent manipulation for red-teaming purposes
专题命中 安全训练 :jailbreak(abstract);分类 cs.CL、cs.AI
专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG
Comments Corrected references
机构 * Nanyang Technological University(南洋理工大学) ; Beijing University of Posts and Telecommunications(北京邮电大学)
专题命中 安全训练 :safety(abstract);分类 cs.AI
Comments Project website is at: https://denghaoyuan123.github.io/SafeBimanip/
专题命中 安全训练 :alignment(abstract);分类 cs.AI
Comments 42 pages, 26 figures
专题命中 安全训练 :safety(abstract);分类 cs.LG