arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-10-13 至 2025-10-13 共收录 4 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 4 篇

2510.09023 2025-10-13 cs.LG cs.CR 79%

The Attacker Moves Second: Stronger Adaptive Attacks Bypass Defenses Against Llm Jailbreaks and Prompt Injections

Milad Nasr, Nicholas Carlini, Chawin Sitawarin, Sander V. Schulhoff, Jamie Hayes, Michael Ilie, Juliette Pluto, Shuang Song, Harsh Chaudhari, Ilia Shumailov, Abhradeep Thakurta, Kai Yuanqing Xiao, Andreas Terzis, Florian Tramèr

机构 * OpenAI Anthropic Google DeepMind(谷歌DeepMind) HackAPrompt Northeastern University(东北大学) ETH Zürich(苏黎世联邦理工学院) AI Sequrity Company(AI安全公司) MATS Main contributors(MATS主要贡献者)

专题命中 越狱攻击 :prompt injection(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06594 2025-10-13 cs.CL 79%

Do Internal Layers of LLMs Reveal Patterns for Jailbreak Detection?

Sri Durga Sai Sowmya Kadali, Evangelos E. Papalexakis

机构 * Dept. of Computer Science and Engineering University of California, Riverside(计算机科学与工程系加州大学河滨分校)

专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01644 2025-10-13 cs.CL cs.AI cs.CY 75%

Machine Learning for Detection and Analysis of Novel LLM Jailbreaks

John Hawkins, Aditya Pramar, Rodney Beard, Rohitash Chandra

机构 * Centre for Artificial Intelligence and Innovation(人工智能与创新中心) Pingla Institute(平拉研究所) Transitional Artificial Intelligence Research Group(过渡人工智能研究组) UNSW(新南威尔士大学)

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI、cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09471 2025-10-13 cs.CL 70%

Getting Your Indices in a Row: Full-Text Search for LLM Training Data for Real World

Ines Altemir Marinas, Anastasiia Kucherenko, Alexander Sternfeld, Andrei Kucharavy

机构 * IC, EPFL(EPFL)

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏