arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-09-30 至 2025-09-30 共收录 5 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 隐私与版权 5 篇

2503.22948 2025-09-30 cs.CL cs.AI cs.CY cs.LG 70%

SUV: Scalable Large Language Model Copyright Compliance with Regularized Selective Unlearning

Tianyang Xu, Xiaoze Liu, Feijie Wu, Xiaoqian Wang, Jing Gao

机构 * Purdue University(普渡大学)

专题命中 隐私与版权 :DPO(abstract);分类 cs.CL、cs.AI、cs.CY

Comments COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24488 2025-09-30 cs.CL cs.CR cs.LG 62%

Sanitize Your Responses: Mitigating Privacy Leakage in Large Language Models

Wenjie Fu, Huandong Wang, Junyao Gao, Guoan Wan, Tao Jiang

专题命中 隐私与版权 :safety(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10171 2025-09-30 cs.CR cs.AI cs.CL 62%

Beyond Jailbreaking: Auditing Contextual Privacy in LLM Agents

Saswat Das, Jameson Sandler, Ferdinando Fioretto

专题命中 隐私与版权 :safety(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04117 2025-09-30 cs.CL 57%

Unveiling Over-Memorization in Finetuning LLMs for Reasoning Tasks

Zhiwen Ruan, Yun Chen, Yutao Hou, Peng Li, Yang Liu, Guanhua Chen

机构 * Southern University of Science and Technology(南方科技大学) Tsinghua University(清华大学) Shanghai University of Finance and Economics(上海财经大学)

专题命中 隐私与版权 :alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24043 2025-09-30 cs.CR 50%

An Ensemble Framework for Unbiased Language Model Watermarking

Yihan Wu, Ruibo Chen, Georgios Milis, Heng Huang

专题命中 隐私与版权 :safety(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏