arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-08-06 至 2025-08-06 共收录 2 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 2 篇

2504.13134 2025-08-06 cs.CL cs.LG stat.ML 84%

Energy-Based Reward Models for Robust Language Model Alignment

Anamika Lochab, Ruqi Zhang

机构 * Department of Computer Science(计算机科学系) Purdue University(普渡大学)

专题命中 偏好对齐 :alignment(title,abstract);safety(abstract);分类 cs.CL、cs.LG

Comments Accepted by COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05070 2025-08-06 cs.CL 57%

RIVAL: Reinforcement Learning with Iterative and Adversarial Optimization for Machine Translation

Tianjiao Li, Mengran Yu, Chenyu Shi, Yanjun Zhao, Xiaojing Liu, Qiang Zhang, Qi Zhang, Xuanjing Huang, Jiayin Wang

机构 * Bilibili Inc.(哔哩哔哩公司) Xi’an Jiaotong University(西安交通大学) School of Computer Science, Fudan University(复旦大学计算机科学学院)

专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏