arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-10-07 至 2025-10-07 共收录 6 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 6 篇

2411.04712 2025-10-07 cs.CV cs.LG 79%

SEE-DPO: Self Entropy Enhanced Direct Preference Optimization

Shivanshu Shekhar, Shreyas Singh, Tong Zhang

机构 * Siebel School of Computing and Data Science(计算与数据科学学院) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Fractal AI Research(Fractal AI研究院)

专题命中 偏好对齐 :DPO(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07510 2025-10-07 cs.CV cs.LG 79%

Divergence Minimization Preference Optimization for Diffusion Model Alignment

Binxu Li, Minkai Xu, Jiaqi Han, Meihua Dang, Stefano Ermon

机构 * Stanford University(斯坦福大学)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.12491 2025-10-07 cs.CL 70%

Insights from the Inverse: Reconstructing LLM Training Goals Through Inverse Reinforcement Learning

Jared Joselowitz, Ritam Majumdar, Arjun Jagota, Matthieu Bou, Nyal Patel, Satyapriya Krishna, Sonali Parbhoo

机构 * Imperial College London(伦敦帝国学院) Harvard University(哈佛大学)

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.CL

Comments Published as a conference paper at COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19281 2025-10-07 cs.LG 70%

A Snapshot of Influence: A Local Data Attribution Framework for Online Reinforcement Learning

Yuzheng Hu, Fan Wu, Haotian Ye, David Forsyth, James Zou, Nan Jiang, Jiaqi W. Ma, Han Zhao

机构 * UIUC Urbana(伊利诺伊大学 Urbana分校) Stanford University(斯坦福大学)

专题命中 偏好对齐 :RLHF(abstract);safety(abstract);分类 cs.LG

Comments Accepted at NeurIPS 2025 as an oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.16810 2025-10-07 cs.CL cs.AI 62%

Can GPT models Follow Human Summarization Guidelines? A Study for Targeted Communication Goals

Yongxin Zhou, Fabien Ringeval, François Portet

机构 * Univ. Grenoble Alpes, CNRS, Inria, Grenoble INP, LIG(格勒诺布尔阿尔卑斯大学、国家科学研究中心、法国国家信息与自动化研究所、格勒诺布尔INP、实验室)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI

Comments INLG 2025, Hanoi, Vietnam, October 29 - November 2, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25361 2025-10-07 cs.AI 57%

Structural Reward Model: Enhancing Interpretability, Efficiency, and Scalability in Reward Modeling

Xiaoyu Liu, Di Liang, Chang Dai, Hongyu Shan, Peiyang Liu, Yonghao Liu, Muling Wu, Yuntao Li, Xianjie Wu, LI Miao, Jiangrong Shen, Minlong Peng

机构 * Northeastern University, Boston(东北大学,波士顿) Independent Developer(独立开发者) Peiking University(北京大学) Jilin University(吉林大学) Beihang University(北航) Xi’an Jiaotong University(西安交通大学) Baidu Inc(百度公司)

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏