arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-02-23 至 2026-02-23 共收录 3 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 3 篇

2602.11495 2026-02-23 cs.CR cs.CL 79%

Jailbreaking Leaves a Trace: Understanding and Detecting Jailbreak Attacks from Internal Representations of Large Language Models

对大型语言模型进行劫持留有痕迹:从内部表示理解并检测劫持攻击

Sri Durga Sai Sowmya Kadali, Evangelos E. Papalexakis

机构 * University of California, Riverside(加州大学河滨分校)

专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.CL

AI总结 本文提出了一种基于张量的潜在表示框架,通过分析LLM内部表示差异来检测劫持攻击,并在推理阶段主动干扰劫持执行。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17837 2026-02-23 cs.CR cs.CL cs.LG 62%

TFL: Targeted Bit-Flip Attack on Large Language Model

TFL:针对大语言模型的定向位翻转攻击

Jingkai Guo, Chaitali Chakrabarti, Deliang Fan

机构 * School of Electrical, Computer and Energy Engineering(电气、计算机与能源工程学院) Arizona State University(亚利桑那州立大学)

专题命中 越狱攻击 :safety(abstract);分类 cs.CL、cs.LG

AI总结 TFL是一种新型定向位翻转攻击框架,通过精确操控LLM输出并减少对无关输入的影响,提升攻击的隐蔽性和针对性。

Comments 13 pages, 11 figures. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18079 2026-02-23 cs.CR cs.RO 50%

Dynamic Deception: When Pedestrians Team Up to Fool Autonomous Cars

动态欺骗:当行人联手欺骗自动驾驶汽车

Masoud Jamshidiyan Tehrani, Marco Gabriel, Jinhan Kim, Paolo Tonella

机构 * Università della Svizzera italiana(瑞士意大利大学)

专题命中 越狱攻击 :safety(abstract)

AI总结 本文提出通过多个动态元素协作放大对抗信号,以引发自动驾驶车辆的系统级故障,展示动态协作在对抗攻击中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏