arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-02-02 至 2026-02-02 共收录 3 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 隐私与版权 3 篇

2601.22434 2026-02-02 cs.CR cs.CY cs.LG 62%

Rethinking Anonymity Claims in Synthetic Data Generation: A Model-Centric Privacy Attack Perspective

重新思考合成数据生成中的匿名性主张:一种以模型为中心的隐私攻击视角

Georgi Ganev, Emiliano De Cristofaro

机构 * UCL(伦敦大学学院) SAS(SAS公司) UC Riverside(加州大学河滨分校)

专题命中 隐私与版权 :trustworthy(abstract);分类 cs.CY、cs.LG

AI总结 本文从模型为中心的视角重新审视合成数据生成中的匿名性主张,强调需考虑生成模型能力和隐私攻击,指出合成数据技术不足以保证匿名性,并比较差分隐私与相似性隐私度量的优劣。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22935 2026-02-02 cs.CR cs.AI 57%

Protecting Private Code in IDE Autocomplete using Differential Privacy

在IDE自动补全中使用差分隐私保护私有代码

Evgeny Grigorenko, David Stanojević, David Ilić, Egor Bogomolov, Kostadin Cvejoski

机构 * JetBrains Research(JetBrains研究)

专题命中 隐私与版权 :trustworthy(abstract);分类 cs.AI

AI总结 本文提出利用差分隐私保护IDE自动补全中用户代码隐私,通过DP训练模型有效防御成员推断攻击,同时保持模型性能。

Comments 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20161 2026-02-02 cs.HC 50%

Supporting Informed Self-Disclosure: Design Recommendations for Presenting AI-Estimates of Privacy Risks to Users

支持知情自我披露:为向用户呈现AI估计的隐私风险提供设计建议

Isadora Krsek, Meryl Ye, Wei Xu, Alan Ritter, Laura Dabbish, Sauvik Das

专题命中 隐私与版权 :safety(abstract)

AI总结 本文通过设计虚构和漫画板方法,提出四个设计建议,帮助用户理解AI估计的隐私风险,以促进知情的自我披露决策。

详情

展开后加载摘要…

URL PDF HTML 收藏