arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-08-25 至 2026-08-25 共收录 2 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 隐私与版权 2 篇

2608.23020 2026-08-25 cs.CL cs.AI 新提交 62%

Unlearning Is Not Just Erasing: Temporal Decoupling via Generation Inequality

遗忘学习不只是擦除:通过生成不平等实现时间解耦

Xunlei Chen, Qirui Ye, Yuang Li, Yi Gong, Zhaokun Wang, Wenyi Li, Shiyao Guo, Jinyu Guo

专题命中 隐私与版权 :safety(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对大型语言模型遗忘学习的挑战,提出基于训练的细粒度框架ADU,通过解耦上下文注意力路径实现精准遗忘,在TOFU和WMDP基准上表现最优,同时保留高模型效用并减少副作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10145 2026-08-25 cs.CR 版本更新 50%

Mask-Free Privacy Extraction and Rewriting: A Domain-Aware Approach via Prototype Learning

无掩码隐私提取与重写:通过原型学习的领域感知方法

Xiaodong Li, Yuhua Wang, Qingchen Yu, Zixuan Qin, Yifan Sun, Qinnan Zhang, Hainan Zhang, Zhiming Zheng

专题命中 隐私与版权 :alignment(abstract)

AI总结 本文提出DAMPER方法,通过对比学习生成领域隐私原型,实现精确的跨度定位和领域合规的重写策略,提升隐私与效用的平衡。

Comments EMNLP 2026 camera-ready. First two authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏