arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-02-25 至 2026-02-25 共收录 3 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 3 篇

2506.04462 2026-02-25 cs.CL cs.CR cs.LG 84%

Watermarking Degrades Alignment in Language Models: Analysis and Mitigation

水印会损害语言模型的对齐:分析与缓解

Apurv Verma, NhatHai Phan, Shubhendu Trivedi

机构 * New Jersey Institute of Technology(新泽西理工学院)

专题命中 偏好对齐 :alignment(title,abstract);safety(abstract);分类 cs.CL、cs.LG

AI总结 研究发现水印影响语言模型对齐,提出Alignment Resampling方法恢复对齐性能。

Comments Published in Transactions of Machine Learning Research 02/2026. Extended version of the earlier paper published at the 1st Workshop on GenAI Watermarking (ICLR 2025)

Journal ref Transactions of Machine Learning Research 02/2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20457 2026-02-25 cs.LG stat.ML 79%

Oracle-Robust Online Alignment for Large Language Models

面向大语言模型的Oracle鲁棒在线对齐

Zimeng Li, Mudit Gaur, Vaneet Aggarwal

机构 * Purdue University(普渡大学)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.LG

AI总结 本文提出了一种Oracle鲁棒的在线对齐方法,通过引入不确定性集和敏感性惩罚,实现了对大语言模型在不准确偏好反馈下的鲁棒优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20595 2026-02-25 cs.CR cs.AI 57%

OptiLeak: Efficient Prompt Reconstruction via Reinforcement Learning in Multi-tenant LLM Services

OptiLeak: 通过强化学习在多租户LLM服务中高效重建提示

Longxiang Wang, Xiang Zheng, Xuhao Zhang, Yao Zhang, Ye Wu, Cong Wang

机构 * City University of Hong Kong(香港城市大学) ByteDance Inc.(字节跳动公司)

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI

AI总结 OptiLeak通过强化学习和两阶段微调,在多租户LLM服务中高效重建提示,减少请求次数达12.48倍,提升隐私保护。

详情

展开后加载摘要…

URL PDF HTML 收藏