arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-02-09 至 2026-02-09 共收录 1 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 提示注入 1 篇

2507.02735 2026-02-09 cs.CR cs.AI 79%

Meta SecAlign: A Secure Foundation LLM Against Prompt Injection Attacks

Meta SecAlign: 一种针对提示注入攻击的 secure LLM 基础

Sizhe Chen, Arman Zharmagambetov, David Wagner, Chuan Guo

机构 * FAIR at Meta(Meta 的 FAIR 部门) UC Berkeley(加州大学伯克利分校)

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.AI

AI总结 Meta SecAlign 是首个开源的 LLM,具备内置的模型级防御,实现了商业级性能,且在复杂代理任务中表现优异,同时在提示注入攻击中展现出更高的安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏