arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-12-17 至 2025-12-17 共收录 4 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 4 篇

2512.13741 2025-12-17 cs.LG cs.AI 82%

The Laminar Flow Hypothesis: Detecting Jailbreaks via Semantic Turbulence in Large Language Models

层流假说:通过大语言模型中的语义湍流检测对抗性突破

Md. Hasib Ur Rahman

机构 * Brac University(布拉克大学)

专题命中 越狱攻击 :alignment(abstract);RLHF(abstract);safety(abstract);jailbreak(abstract)

AI总结 本研究提出层流假说,通过检测大语言模型中的语义湍流,实现对抗性突破的实时检测与安全架构诊断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17874 2025-12-17 cs.CR 78%

Beyond Jailbreak: Unveiling Risks in LLM Applications Arising from Blurred Capability Boundaries

超越劫持:揭示LLM应用中因能力边界模糊而产生的风险

Yunyi Zhang, Shibo Cui, Baojun Liu, Jingkai Yu, Min Zhang, Fan Shi, Han Zheng

专题命中 越狱攻击 :jailbreak(title,abstract)

AI总结 本文研究了LLM应用中因能力边界模糊导致的能力降级和升级风险,提出评估框架并揭示了应用安全性的关键影响因素。

Comments Accepted by Network and Distributed System Security (NDSS) Symposium 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14448 2025-12-17 cs.CR cs.AI 57%

Reasoning-Style Poisoning of LLM Agents via Stealthy Style Transfer: Process-Level Attacks and Runtime Monitoring in RSV Space

通过隐蔽的风格迁移进行LLM代理的推理风格污染:过程级攻击与运行时监控在RSV空间中

Xingfu Zhou, Pengfei Wang

机构 * college of computer science, National University of Defense Technology(计算机科学学院,国防科技大学)

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

AI总结 本研究提出推理风格污染攻击,通过隐蔽方式改变LLM代理的推理风格,导致性能下降并绕过内容过滤,提出运行时监控方法应对该漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13703 2025-12-17 cs.CR cs.AI 57%

Safe2Harm: Semantic Isomorphism Attacks for Jailbreaking Large Language Models

Safe2Harm: 语义同构攻击用于大型语言模型的劫持

Fan Yang

机构 * Jinan University(济南大学)

专题命中 越狱攻击 :jailbreak(abstract);分类 cs.AI

AI总结 Safe2Harm通过语义同构攻击方法,利用合法与有害场景的底层原理一致性,实现高效的大规模语言模型劫持,并提出有害内容评估数据集用于防御。

详情

展开后加载摘要…

URL PDF HTML 收藏