arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-07-03 至 2026-07-03 共收录 2 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 2 篇

2607.01277 2026-07-03 cs.CR 新提交 82%

Cognitive Firewall: A Proactive, Zero-Trust, Multi-Gate Framework for LLM Safety

认知防火墙:一种主动、零信任、多门控的LLM安全框架

Michele Guida, Ruslan Shikhhamzayev, Sindhuja Penchala, Stefano Iannucci, Jiacheng Li, Shahram Rahimi, Noorbakhsh Amiri Golilarz

专题命中 越狱攻击 :safety(title,abstract);jailbreak(abstract)

AI总结 提出认知防火墙框架,通过意图、零信任上下文、一致性和输出风险四个门控进行对话级安全评估,有效降低单轮、多轮、基于权威和人工制作的越狱攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01356 2026-07-03 cs.CR cs.SY eess.SY 新提交 50%

Chameleon: Recovering Cyber-Physical Systems from Memory Corruption Attacks via ML Surrogates

Chameleon: 通过ML代理从内存破坏攻击中恢复信息物理系统

Mohsen Salehi, Karthik Pattabiraman

专题命中 越狱攻击 :safety(abstract)

AI总结 提出Chameleon框架,利用基于机器学习的代理在检测到攻击时替换受损组件,实现信息物理系统从内存破坏攻击中的自动恢复,在多种机器人车辆上验证了高保真度和低开销。

详情

展开后加载摘要…

URL PDF HTML 收藏