arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-02-17 至 2026-02-17 共收录 2 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 提示注入 2 篇

2602.13284 2026-02-17 cs.SI cs.AI 83%

Agents in the Wild: Safety, Society, and the Illusion of Sociality on Moltbook

真实世界中的代理:安全、社会与社会性幻觉

Yunbei Zhang, Kai Mei, Ming Liu, Janet Wang, Dimitris N. Metaxas, Xiao Wang, Jihun Hamm, Yingqiang Ge

机构 * Tulane University(路易斯安那州立大学) Rutgers University(罗格斯大学) Iowa State University(爱荷华州立大学) Oak Ridge National Laboratory(橡树岭国家实验室)

专题命中 提示注入 :safety(title,abstract);prompt injection(abstract);分类 cs.AI

AI总结 研究发现Moltbook中代理自发形成社会结构,但互动空洞,安全威胁主要通过社会工程实现,揭示了AI社交平台的潜在风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23519 2026-02-17 cs.CR cs.AI 57%

ReliabilityRAG: Effective and Provably Robust Defense for RAG-based Web-Search

ReliabilityRAG: 有效且可证明的防御方法用于基于检索的Web搜索

Zeyu Shen, Basileal Imana, Tong Wu, Chong Xiang, Prateek Mittal, Aleksandra Korolova

机构 * Department of Computer Science(计算机科学系) Princeton University(普林斯顿大学) Center for Information Technology Policy(信息政策中心) Department of Electrical and Computer Engineering(电气与计算机工程系) NVIDIA(英伟达)

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 ReliabilityRAG通过利用文档可靠性信息,提供更有效且可证明鲁棒的防御方法,以增强基于检索的Web搜索系统对对抗攻击的抵御能力。

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏