arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-10-23 至 2025-10-23 共收录 3 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 隐私与版权 3 篇

2506.10946 2025-10-23 cs.LG cs.AI cs.CL 67%

GUARD: Guided Unlearning and Retention via Data Attribution for Large Language Models

Peizhi Niu, Evelyn Ma, Huiting Zhou, Duo Zhou, Huan Zhang, S. Rasoul Etesami, Olgica Milenkovic

机构 * Department of Electrical & Computer Engineering(电气与计算机工程系) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 隐私与版权 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08727 2025-10-23 cs.LG cs.AI cs.CL cs.IT math.IT 67%

Memorization-Compression Cycles Improve Generalization

Fangyuan Yu

机构 * Thoughtworks

专题命中 隐私与版权 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 12 pages, 6 figures, NeurIPS2025 NEGEL Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19036 2025-10-23 cs.CL 57%

From Memorization to Generalization: Fine-Tuning Large Language Models for Biomedical Term-to-Identifier Normalization

Suswitha Pericharla, Daniel B. Hier, Tayo Obafemi-Ajayi

专题命中 隐私与版权 :alignment(abstract);分类 cs.CL

Comments Submitted for publication to BMC BioData Mining

详情

展开后加载摘要…

URL PDF HTML 收藏