arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-08-28 至 2026-08-28 共收录 3 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 提示注入 3 篇

2608.07167 2026-08-28 cs.AI 版本更新 70%

NiyamAI - An Intent-Bound AI Agent with Cryptographically Verifiable Guardrails using Zero-Knowledge Proofs

NiyamAI——一种使用零知识证明实现密码学可验证护栏的意图绑定AI智能体

Aditya Katkar, Om Karkele, Kartik Mandhane, Manisha More, Yash Kashid

专题命中 提示注入 :safety(abstract);prompt injection(abstract);分类 cs.AI

AI总结 Niyam-AI是一种基于零知识证明的意图绑定AI智能体框架,通过SHA-256承诺意图合约、Judge模型验证和zk-SNARK确保证明,在Agent-SafetyBench评估中较多款基线护栏实现显著安全性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27092 2026-08-28 cs.CR 新提交 67%

The Framing Gap: Indirect Prompt-Injection Exfiltration Defeats Surface-Level Defenses in Tool-Using Agents

框架缺口:间接提示注入数据泄露可突破使用工具智能体的表层防御

Md Habibur Rahman, Jaeho Kim

专题命中 提示注入 :alignment(abstract);prompt injection(abstract)

AI总结 该研究发现使用工具的智能体存在框架缺口,间接提示注入攻击可通过重新表述泄露内容突破表层防御,需通过目标约束或能力隔离等手段提升鲁棒性。

Comments 20 pages, 3 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26108 2026-08-28 cs.SE 新提交 67%

Agentic AI Containment Architecture for Security Hardening

用于安全加固的智能体AI containment架构

Mohamed ElBendary

专题命中 提示注入 :safety(abstract);prompt injection(abstract)

AI总结 针对多智能体AI系统的安全风险,本文提出Agent Containment架构,通过六项约束实施「提议-验证-行动-验证」模型,可防御多种威胁,案例验证其能产生合规可审计结果。

Comments Accepted to IntelliSys'2026. To Appear in Springer series "Lecture Notes in Networks and Systems" in 2026

详情

展开后加载摘要…

URL PDF HTML 收藏