Cognitive Firewall: A Proactive, Zero-Trust, Multi-Gate Framework for LLM Safety
认知防火墙:一种主动、零信任、多门控的LLM安全框架
专题命中 越狱攻击 :safety(title,abstract);jailbreak(abstract)
AI总结 提出认知防火墙框架,通过意图、零信任上下文、一致性和输出风险四个门控进行对话级安全评估,有效降低单轮、多轮、基于权威和人工制作的越狱攻击成功率。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
认知防火墙:一种主动、零信任、多门控的LLM安全框架
专题命中 越狱攻击 :safety(title,abstract);jailbreak(abstract)
AI总结 提出认知防火墙框架,通过意图、零信任上下文、一致性和输出风险四个门控进行对话级安全评估,有效降低单轮、多轮、基于权威和人工制作的越狱攻击成功率。
Chameleon: 通过ML代理从内存破坏攻击中恢复信息物理系统
专题命中 越狱攻击 :safety(abstract)
AI总结 提出Chameleon框架,利用基于机器学习的代理在检测到攻击时替换受损组件,实现信息物理系统从内存破坏攻击中的自动恢复,在多种机器人车辆上验证了高保真度和低开销。