arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-08-05 至 2025-08-05 共收录 4 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 4 篇

2406.16306 2025-08-05 cs.CL cs.LG stat.ML 84%

Cascade Reward Sampling for Efficient Decoding-Time Alignment

Bolian Li, Yifan Wang, Anamika Lochab, Ananth Grama, Ruqi Zhang

机构 * Department of Computer Science(计算机科学系)

专题命中 偏好对齐 :alignment(title,abstract);safety(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01930 2025-08-05 cs.CL cs.AI 81%

Word Overuse and Alignment in Large Language Models: The Influence of Learning from Human Feedback

Tom S. Juzek, Zina B. Ward

机构 * Florida State University(佛罗里达州立大学)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL、cs.AI

Comments Accepted for publication in the Proceedings of the 5th Workshop on Bias and Fairness in AI (BIAS 2025) at ECML PKDD

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02312 2025-08-05 cs.CR cs.AI 70%

A Survey on Data Security in Large Language Models

Kang Chen, Xiuze Zhou, Yuanguo Lin, Jinhe Su, Yuanhui Yu, Li Shen, Fan Lin

机构 * School of Computer Engineering, Jimei University, Xiamen, 361021, China(厦门大学计算机工程学院) College of Science, Mathematics and Technology, Wenzhou-Kean University, Wenzhou, 325060, China(温州-凯恩大学科学、数学与技术学院) The Hong Kong University of Science and Technology (Guangzhou), Guangzhou, 511453, China(香港科学与技术大学(广州)) School of Professional Studies, New York University, New York, 10003, United States(纽约大学专业研究学院) School of Informatics, Xiamen University, Xiamen, 361102, China(厦门大学信息学院)

专题命中 偏好对齐 :RLHF(abstract);prompt injection(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.13795 2025-08-05 cs.LG cs.AI 62%

Mix-LN: Unleashing the Power of Deeper Layers by Combining Pre-LN and Post-LN

Pengxiang Li, Lu Yin, Shiwei Liu

机构 * Dalian University of Technology(大连理工大学) University of Surrey(Surrey大学) University of Oxford(牛津大学)

专题命中 偏好对齐 :RLHF(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏