Can AI Keep a Secret? Contextual Integrity Verification: A Provable Security Architecture for LLMs
机构 * Aayush Gupta(独立研究者)
专题命中 越狱攻击 :jailbreak(abstract);prompt injection(abstract);分类 cs.CL、cs.AI
Comments 2 figures, 3 tables; code and certification harness: https://github.com/ayushgupta4897/Contextual-Integrity-Verification ; Elite-Attack dataset: https://huggingface.co/datasets/zyushg/elite-attack