arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-08-26 至 2025-08-26 共收录 7 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 7 篇

2504.13203 2025-08-26 cs.CR cs.AI cs.CL cs.LG cs.MA 80%

X-Teaming: Multi-Turn Jailbreaks and Defenses with Adaptive Multi-Agents

Salman Rahman, Liwei Jiang, James Shiffer, Genglin Liu, Sheriff Issaka, Md Rizwan Parvez, Hamid Palangi, Kai-Wei Chang, Yejin Choi, Saadia Gabriel

专题命中 安全训练 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18556 2025-08-26 cs.CL cs.AI 73%

Exploring the Vulnerability of the Content Moderation Guardrail in Large Language Models via Intent Manipulation

Jun Zhuang, Haibo Jin, Ye Zhang, Zhengjian Kang, Wenbin Zhang, Gaby G. Dagher, Haohan Wang

机构 * Boise State University(博伊州立大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Pittsburgh(匹兹堡大学) New York University(纽约大学) Florida International University(佛罗里达国际大学)

专题命中 安全训练 :safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI

Comments Accepted for EMNLP'25 Findings. TL;DR: We propose a new two-stage intent-based prompt-refinement framework, IntentPrompt, that aims to explore the vulnerability of LLMs' content moderation guardrails by refining prompts into benign-looking declarative forms via intent manipulation for red-teaming purposes

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09600 2025-08-26 cs.MA cs.AI cs.CL cs.CR 62%

Effective Red-Teaming of Policy-Adherent Agents

Itay Nakash, George Kour, Koren Lazar, Matan Vetzler, Guy Uziel, Ateret Anaby-Tavor

专题命中 安全训练 :jailbreak(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18397 2025-08-26 cs.MA cs.AI cs.ET cs.LG 62%

An Outlook on the Opportunities and Challenges of Multi-Agent AI Systems

Fangqiao Tian, An Luo, Jin Du, Xun Xian, Robert Specht, Ganghua Wang, Xuan Bi, Jiawei Zhou, Ashish Kundu, Jayanth Srinivasa, Charles Fleming, Rui Zhang, Zirui Liu, Mingyi Hong, Jie Ding

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

Comments Corrected references

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18268 2025-08-26 cs.RO cs.AI 57%

SafeBimanual: Diffusion-based Trajectory Optimization for Safe Bimanual Manipulation

Haoyuan Deng, Wenkai Guo, Qianzhun Wang, Zhenyu Wu, Ziwei Wang

机构 * Nanyang Technological University(南洋理工大学) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI

Comments Project website is at: https://denghaoyuan123.github.io/SafeBimanip/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17511 2025-08-26 cs.AI 57%

School of Reward Hacks: Hacking harmless tasks generalizes to misaligned behavior in LLMs

Mia Taylor, James Chua, Jan Betley, Johannes Treutlein, Owain Evans

专题命中 安全训练 :alignment(abstract);分类 cs.AI

Comments 42 pages, 26 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17158 2025-08-26 cs.LG 57%

Towards Safeguarding LLM Fine-tuning APIs against Cipher Attacks

Jack Youstra, Mohammed Mahfoud, Yang Yan, Henry Sleight, Ethan Perez, Mrinank Sharma

专题命中 安全训练 :safety(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏