arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-12-19 至 2025-12-19 共收录 2 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 隐私与版权 2 篇

2512.16297 2025-12-19 cs.LG cs.AI 62%

Feature-Selective Representation Misdirection for Machine Unlearning

特征选择性表示误导用于机器去学习

Taozhao Chen, Linghan Huang, Kim-Kwang Raymond Choo, Huaming Chen

机构 * University of Sydney(悉尼大学) University of Texas at San Antonio(德克萨斯大学圣安东尼奥分校)

专题命中 隐私与版权 :safety(abstract);分类 cs.AI、cs.LG

AI总结 SRMU通过特征意识的激活编辑框架,实现安全驱动的模型去学习,有效抑制有害表示并保持模型效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16439 2025-12-19 cs.CR cs.CL 57%

From Essence to Defense: Adaptive Semantic-aware Watermarking for Embedding-as-a-Service Copyright Protection

从本质到防御:面向嵌入即服务版权保护的自适应语义感知水印技术

Hao Li, Yubing Ren, Yanan Cao, Yingjie Li, Fang Fang, Xuebin Wang

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院)

专题命中 隐私与版权 :harmlessness(abstract);分类 cs.CL

AI总结 SemMark是一种基于语义的嵌入即服务版权保护水印技术,通过语义感知水印和自适应权重机制提升防护效果。

详情

展开后加载摘要…

URL PDF HTML 收藏