arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-12-25 至 2025-12-25 共收录 1 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 提示注入 1 篇

2512.20986 2025-12-25 cs.CR 82%

AegisAgent: An Autonomous Defense Agent Against Prompt Injection Attacks in LLM-HARs

AegisAgent:一种对抗LLM-HAR中提示注入攻击的自主防御代理

Yihan Wang, Huanqi Yang, Shantanu Pal, Weitao Xu

专题命中 提示注入 :prompt injection(title,abstract);trustworthy(abstract)

AI总结 AegisAgent通过自主推理和验证机制,有效降低LLM-HAR系统中提示注入攻击的成功率,提升系统安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏