arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-02-05 至 2026-02-05 共收录 3 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 提示注入 3 篇

2511.21752 2026-02-05 cs.CL cs.AI 81%

Semantics as a Shield: Label Disguise Defense (LDD) against Prompt Injection in LLM Sentiment Classification

语义作为盾牌:对抗大语言模型情感分类中提示注入的标签伪装防御(LDD)

Yanxi Li, Ruocheng Shan

机构 * Department of Computer Science, George Washington University(计算机科学系,乔治华盛顿大学)

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出LDD,一种通过语义伪装标签来防御大语言模型情感分类中提示注入攻击的方法,展示了其在不同模型上的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04487 2026-02-05 cs.HC cs.RO 78%

The Supportiveness-Safety Tradeoff in LLM Well-Being Agents

在LLM福祉代理中的支持性与安全性权衡

Himanshi Lalwani, Hanan Salam

专题命中 提示注入 :safety(title,abstract)

AI总结 研究探讨了在LLM福祉代理中支持性与安全性之间的权衡,发现适度支持性提示能提升共情和建设性支持,而强烈验证提示则显著降低安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19207 2026-02-05 cs.CR 78%

Defending Against Prompt Injection with DataFilter

用DataFilter抵御提示注入

Yizhu Wang, Sizhe Chen, Raghad Alkhudair, Basel Alomair, David Wagner

专题命中 提示注入 :prompt injection(title,abstract)

AI总结 DataFilter通过在数据到达LLM前移除恶意指令,有效防御提示注入攻击,同时保持模型的效用。

详情

展开后加载摘要…

URL PDF HTML 收藏