arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 3266 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 3266 篇

2411.01111 2024-11-05 cs.AI 79%

Rule Based Rewards for Language Model Safety

Tong Mu, Alec Helyar, Johannes Heidecke, Joshua Achiam, Andrea Vallone, Ian Kivlichan, Molly Lin, Alex Beutel, John Schulman, Lilian Weng

专题命中 偏好对齐 :safety(title,abstract);分类 cs.AI

Comments Accepted at Neurips 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.22203 2024-10-30 cs.AI cs.HC 79%

Democratizing Reward Design for Personal and Representative Value-Alignment

Carter Blair, Kate Larson, Edith Law

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.AI

Comments 19 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.19806 2024-10-29 cs.LG 79%

Preference Alignment with Flow Matching

Minu Kim, Yongsik Lee, Sehyeok Kang, Jihwan Oh, Song Chong, Se-Young Yun

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.LG

Comments 38th Conference on Neural Information Processing Systems (NeurIPS 2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.17055 2024-10-24 cs.LG stat.ML 79%

Optimal Design for Reward Modeling in RLHF

Antoine Scheid, Etienne Boursier, Alain Durmus, Michael I. Jordan, Pierre Ménard, Eric Moulines, Michal Valko

专题命中 偏好对齐 :RLHF(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.15651 2024-10-22 cs.LG 79%

Understanding and Alleviating Memory Consumption in RLHF for LLMs

Jin Zhou, Hanmei Yang, Steven, Tang, Mingcan Xiang, Hui Guan, Tongping Liu

专题命中 偏好对齐 :RLHF(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.12194 2024-10-17 cs.CL 79%

Negative-Prompt-driven Alignment for Generative Language Model

Shiqi Qiao, Ning Xv, Biao Liu, Xin Geng

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.12318 2024-10-15 cs.CL 79%

Reuse Your Rewards: Reward Model Transfer for Zero-Shot Cross-Lingual Alignment

Zhaofeng Wu, Ananth Balashankar, Yoon Kim, Jacob Eisenstein, Ahmad Beirami

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL

Comments EMNLP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.15951 2024-10-14 cs.CL 79%

Modular Pluralism: Pluralistic Alignment via Multi-LLM Collaboration

Shangbin Feng, Taylor Sorensen, Yuhan Liu, Jillian Fisher, Chan Young Park, Yejin Choi, Yulia Tsvetkov

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL

Comments EMNLP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.09279 2024-10-10 cs.CL 79%

Unpacking DPO and PPO: Disentangling Best Practices for Learning from Preference Feedback

Hamish Ivison, Yizhong Wang, Jiacheng Liu, Zeqiu Wu, Valentina Pyatkin, Nathan Lambert, Noah A. Smith, Yejin Choi, Hannaneh Hajishirzi

专题命中 偏好对齐 :DPO(title,abstract);分类 cs.CL

Comments Neurips 2024 camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.05000 2024-10-08 cs.CL 79%

Pedagogical Alignment of Large Language Models

Shashank Sonkar, Kangqi Ni, Sapana Chaudhary, Richard G. Baraniuk

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL

Comments Accepted at EMNLP 2024 Findings Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.07401 2024-10-08 cs.AI 79%

On Diversified Preferences of Large Language Model Alignment

Dun Zeng, Yong Dai, Pengyu Cheng, Longyue Wang, Tianhao Hu, Wanshun Chen, Nan Du, Zenglin Xu

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.AI

Comments EMNLP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.12606 2024-10-04 cs.CL 79%

Not Everything is All You Need: Toward Low-Redundant Optimization for Large Language Model Alignment

Zhipeng Chen, Kun Zhou, Wayne Xin Zhao, Jingyuan Wang, Ji-Rong Wen

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL

Comments 14 pages, working in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.15116 2024-08-28 cs.AI 79%

Evaluating Stability of Unreflective Alignment

James Lucassen, Mark Henry, Philippa Wright, Owen Yeung

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.17387 2024-07-25 cs.CL 79%

PERSONA: A Reproducible Testbed for Pluralistic Alignment

Louis Castricato, Nathan Lile, Rafael Rafailov, Jan-Philipp Fränken, Chelsea Finn

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.06025 2024-07-17 cs.CL 79%

ChiMed-GPT: A Chinese Medical Large Language Model with Full Training Regime and Better Alignment to Human Preferences

Yuanhe Tian, Ruyi Gan, Yan Song, Jiaxing Zhang, Yongdong Zhang

专题命中 偏好对齐 :alignment(title);RLHF(abstract);分类 cs.CL

Comments 18 pages, 3 figures; Accepted by ACL-2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.13210 2024-07-04 cs.LG 79%

Bayesian Reward Models for LLM Alignment

Adam X. Yang, Maxime Robeyns, Thomas Coste, Zhengyan Shi, Jun Wang, Haitham Bou-Ammar, Laurence Aitchison

专题命中 偏好对齐 :alignment(title);RLHF(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.15178 2024-06-24 cs.CL 79%

Hybrid Alignment Training for Large Language Models

Chenglong Wang, Hang Zhou, Kaiyan Chang, Bei Li, Yongyu Mu, Tong Xiao, Tongran Liu, Jingbo Zhu

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL

Comments accepted by ACL (Findings) 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.08657 2024-06-14 cs.CL 79%

Mistral-C2F: Coarse to Fine Actor for Analytical and Reasoning Enhancement in RLHF and Effective-Merged LLMs

Chen Zheng, Ke Sun, Xun Zhou

专题命中 偏好对齐 :RLHF(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.08469 2024-06-13 cs.LG 79%

PAL: Pluralistic Alignment Framework for Learning from Heterogeneous Preferences

Daiwei Chen, Yi Chen, Aniket Rege, Ramya Korlakai Vinayak

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.LG

Comments 22 pages, 14 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.05882 2024-06-11 cs.LG stat.ML 79%

Distributional Preference Alignment of LLMs via Optimal Transport

Igor Melnyk, Youssef Mroueh, Brian Belgodere, Mattia Rigotti, Apoorva Nitsure, Mikhail Yurochkin, Kristjan Greenewald, Jiri Navratil, Jerret Ross

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.06886 2024-06-04 cs.LG math.OC stat.ML 79%

Principled Penalty-based Methods for Bilevel Reinforcement Learning and RLHF

Han Shen, Zhuoran Yang, Tianyi Chen

专题命中 偏好对齐 :RLHF(title,abstract);分类 cs.LG

Comments Shorter version accepted to ICML 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.02030 2024-05-24 cs.CL 79%

Panacea: Pareto Alignment via Preference Adaptation for LLMs

Yifan Zhong, Chengdong Ma, Xiaoyuan Zhang, Ziran Yang, Haojun Chen, Qingfu Zhang, Siyuan Qi, Yaodong Yang

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.09824 2024-04-16 cs.CL 79%

Impact of Preference Noise on the Alignment Performance of Generative Language Models

Yang Gao, Dana Alon, Donald Metzler

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.01730 2024-04-03 cs.LG cs.IT math.IT stat.ML 79%

Asymptotics of Language Model Alignment

Joy Qiping Yang, Salman Salamatian, Ziteng Sun, Ananda Theertha Suresh, Ahmad Beirami

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.08785 2024-02-15 cs.CL 79%

InstructGraph: Boosting Large Language Models via Graph-centric Instruction Tuning and Preference Alignment

Jianing Wang, Junda Wu, Yupeng Hou, Yao Liu, Ming Gao, Julian McAuley

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.06080 2024-01-15 cs.AI 79%

Secrets of RLHF in Large Language Models Part II: Reward Modeling

Binghai Wang, Rui Zheng, Lu Chen, Yan Liu, Shihan Dou, Caishuang Huang, Wei Shen, Senjie Jin, Enyu Zhou, Chenyu Shi, Songyang Gao, Nuo Xu, Yuhao Zhou, Xiaoran Fan, Zhiheng Xi, Jun Zhao, Xiao Wang, Tao Ji, Hang Yan, Lixing Shen, Zhan Chen, Tao Gui, Qi Zhang, Xipeng Qiu, Xuanjing Huang, Zuxuan Wu, Yu-Gang Jiang

专题命中 偏好对齐 :RLHF(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.08372 2023-11-06 cs.CL 79%

Improving Factual Consistency for Knowledge-Grounded Dialogue Systems via Knowledge Enhancement and Alignment

Boyang Xue, Weichao Wang, Hongru Wang, Fei Mi, Rui Wang, Yasheng Wang, Lifeng Shang, Xin Jiang, Qun Liu, Kam-Fai Wong

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL

Comments EMNLP2023 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.09055 2023-09-19 cs.CL 79%

Exploring the impact of low-rank adaptation on the performance, efficiency, and regularization of RLHF

Simeng Sun, Dhawal Gupta, Mohit Iyyer

专题命中 偏好对齐 :RLHF(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2204.05196 2022-04-12 cs.LG 79%

Automatically Learning Fallback Strategies with Model-Free Reinforcement Learning in Safety-Critical Driving Scenarios

Ugo Lecerf, Christelle Yemdji-Tchassi, Sébastien Aubert, Pietro Michiardi

专题命中 偏好对齐 :safety(title,abstract);分类 cs.LG

Comments To appear in proceedings of International Conference on Machine Learning Technologies (ICMLT) 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2012.07228 2020-12-15 cs.AI 79%

Trustworthy Preference Completion in Social Choice

Lei Li, Minghe Xue, Huanhuan Chen, Xindong Wu

专题命中 偏好对齐 :trustworthy(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏