arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 3266 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 3266 篇

2412.13998 2024-12-19 cs.LG cs.AI 81%

Few-shot Steerable Alignment: Adapting Rewards and LLM Policies with Neural Processes

Katarzyna Kobalczyk, Claudio Fanconi, Hao Sun, Mihaela van der Schaar

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.06000 2024-12-10 cs.CL cs.LG 81%

Does RLHF Scale? Exploring the Impacts From Data, Model, and Method

Zhenyu Hou, Pengfan Du, Yilin Niu, Zhengxiao Du, Aohan Zeng, Xiao Liu, Minlie Huang, Hongning Wang, Jie Tang, Yuxiao Dong

专题命中 偏好对齐 :RLHF(title,abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.04305 2024-12-06 cs.CL cs.LG 81%

ALMA: Alignment with Minimal Annotation

Michihiro Yasunaga, Leonid Shamis, Chunting Zhou, Andrew Cohen, Jason Weston, Luke Zettlemoyer, Marjan Ghazvininejad

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.09223 2024-11-22 cs.CL cs.AI 81%

Word Alignment as Preference for Machine Translation

Qiyu Wu, Masaaki Nagata, Zhongtao Miao, Yoshimasa Tsuruoka

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL、cs.AI

Comments EMNLP 2024 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.11937 2024-11-20 cs.LG cs.AI 81%

Value Imprint: A Technique for Auditing the Human Values Embedded in RLHF Datasets

Ike Obi, Rohan Pant, Srishti Shekhar Agrawal, Maham Ghazanfar, Aaron Basiletti

专题命中 偏好对齐 :RLHF(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.14758 2024-11-08 cs.GT cs.AI cs.LG 81%

Axioms for AI Alignment from Human Feedback

Luise Ge, Daniel Halpern, Evi Micha, Ariel D. Procaccia, Itai Shapira, Yevgeniy Vorobeychik, Junlin Wu

专题命中 偏好对齐 :alignment(title);RLHF(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.09345 2024-11-04 cs.LG cs.AI 81%

InfoRM: Mitigating Reward Hacking in RLHF via Information-Theoretic Reward Modeling

Yuchun Miao, Sen Zhang, Liang Ding, Rong Bao, Lefei Zhang, Dacheng Tao

专题命中 偏好对齐 :RLHF(title,abstract);分类 cs.AI、cs.LG

Comments The paper has been accepted by NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.09385 2024-10-31 cs.CL cs.AI 81%

Reward Difference Optimization For Sample Reweighting In Offline RLHF

Shiqi Wang, Zhengze Zhang, Rui Zhao, Fei Tan, Cam Tu Nguyen

专题命中 偏好对齐 :RLHF(title,abstract);分类 cs.CL、cs.AI

Comments EMNLP 2024 findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.22304 2024-10-30 cs.CL cs.LG 81%

Flow-DPO: Improving LLM Mathematical Reasoning through Online Multi-Agent Learning

Yihe Deng, Paul Mineiro

专题命中 偏好对齐 :DPO(title,abstract);分类 cs.CL、cs.LG

Comments 5 pages, 4 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.19206 2024-10-28 cs.LG cs.CL 81%

Inference time LLM alignment in single and multidomain preference spectrum

Sadat Shahriar, Zheng Qi, Nikolaos Pappas, Srikanth Doss, Monica Sunkara, Kishaloy Halder, Manuel Mager, Yassine Benajiba

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.18533 2024-10-25 cs.CL cs.AI 81%

LOGO -- Long cOntext aliGnment via efficient preference Optimization

Zecheng Tang, Zechen Sun, Juntao Li, Qiaoming Zhu, Min Zhang

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.09528 2024-10-25 cs.LG cs.AI 81%

Boosting Deductive Reasoning with Step Signals In RLHF

Jialian Li, Yipin Zhang, Wei Shen, Yuzi Yan, Jian Xie, Dong Yan

专题命中 偏好对齐 :RLHF(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.00508 2024-10-15 cs.CL cs.AI 81%

FlipGuard: Defending Preference Alignment against Update Regression with Constrained Optimization

Mingye Zhu, Yi Liu, Quan Wang, Junbo Guo, Zhendong Mao

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL、cs.AI

Comments Accepted by EMNLP 2024 Main track

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.08639 2024-10-15 cs.AI cs.LG 81%

$β$-DPO: Direct Preference Optimization with Dynamic $β$

Junkang Wu, Yuexiang Xie, Zhengyi Yang, Jiancan Wu, Jinyang Gao, Bolin Ding, Xiang Wang, Xiangnan He

专题命中 偏好对齐 :DPO(title,abstract);分类 cs.AI、cs.LG

Comments NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.08464 2024-10-08 cs.CL cs.AI 81%

Magpie: Alignment Data Synthesis from Scratch by Prompting Aligned LLMs with Nothing

Zhangchen Xu, Fengqing Jiang, Luyao Niu, Yuntian Deng, Radha Poovendran, Yejin Choi, Bill Yuchen Lin

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL、cs.AI

Comments Link: https://magpie-align.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.01789 2024-10-03 cs.LG cs.AI 81%

Investigating on RLHF methodology

Alexey Kutalev, Sergei Markoff

专题命中 偏好对齐 :RLHF(title);alignment(abstract);分类 cs.AI、cs.LG

Comments 23 pages, 6 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.18995 2024-10-01 cs.CL cs.AI 81%

Systematic Characterization of the Effectiveness of Alignment in Large Language Models for Categorical Decisions

Isaac Kohane

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL、cs.AI

Comments 19 pages (without Appendix) Appendix 7 pages. 7 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.10392 2024-08-21 cs.CL cs.LG 81%

Value Alignment from Unstructured Text

Inkit Padhi, Karthikeyan Natesan Ramamurthy, Prasanna Sattigeri, Manish Nagireddy, Pierre Dognin, Kush R. Varshney

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.04655 2024-08-13 cs.CL cs.AI 81%

Strong and weak alignment of large language models with human values

Mehdi Khamassi, Marceau Nahon, Raja Chatila

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL、cs.AI

Comments Accepted for publication in Scientific Reports, special issue on AI aligment

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.18742 2024-08-08 cs.LG cs.AI 81%

Understanding the Learning Dynamics of Alignment with Human Feedback

Shawn Im, Yixuan Li

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.03716 2024-07-12 cs.CL cs.LG 81%

A Long Way to Go: Investigating Length Correlations in RLHF

Prasann Singhal, Tanya Goyal, Jiacheng Xu, Greg Durrett

专题命中 偏好对齐 :RLHF(title,abstract);分类 cs.CL、cs.LG

Comments 21 pages, 13 figures, Accepted to COLM 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.06606 2024-07-09 cs.CL cs.AI 81%

Prototypical Reward Network for Data-Efficient RLHF

Jinghan Zhang, Xiting Wang, Yiqiao Jin, Changyu Chen, Xinhao Zhang, Kunpeng Liu

专题命中 偏好对齐 :RLHF(title,abstract);分类 cs.CL、cs.AI

Comments Accepted by ACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.02833 2024-07-04 cs.IR cs.CL cs.LG 81%

LANE: Logic Alignment of Non-tuning Large Language Models and Online Recommendation Systems for Explainable Reason Generation

Hongke Zhao, Songming Zheng, Likang Wu, Bowen Yu, Jing Wang

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.06503 2024-06-11 cs.CL cs.AI 81%

Knowledgeable Preference Alignment for LLMs in Domain-specific Question Answering

Yichi Zhang, Zhuo Chen, Yin Fang, Yanxi Lu, Fangming Li, Wen Zhang, Huajun Chen

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL、cs.AI

Comments Accepted by ACL 2024 (Findings). Code is available at https://github.com/zjukg/KnowPAT

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.20304 2024-05-31 cs.CL cs.LG 81%

Group Robust Preference Optimization in Reward-free RLHF

Shyam Sundhar Ramesh, Yifan Hu, Iason Chaimalas, Viraj Mehta, Pier Giuseppe Sessa, Haitham Bou Ammar, Ilija Bogunovic

专题命中 偏好对齐 :RLHF(title,abstract);分类 cs.CL、cs.LG

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.19107 2024-05-30 cs.LG cs.AI 81%

Offline Regularised Reinforcement Learning for Large Language Models Alignment

Pierre Harvey Richemond, Yunhao Tang, Daniel Guo, Daniele Calandriello, Mohammad Gheshlaghi Azar, Rafael Rafailov, Bernardo Avila Pires, Eugene Tarassov, Lucas Spangher, Will Ellsworth, Aliaksei Severyn, Jonathan Mallinson, Lior Shani, Gil Shamir, Rishabh Joshi, Tianqi Liu, Remi Munos, Bilal Piot

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.17713 2024-05-29 cs.AI cs.LG 81%

AI Alignment with Changing and Influenceable Reward Functions

Micah Carroll, Davis Foote, Anand Siththaranjan, Stuart Russell, Anca Dragan

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.AI、cs.LG

Comments Accepted to ICML 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.00254 2024-05-28 cs.AI cs.LG 81%

RLHF from Heterogeneous Feedback via Personalization and Preference Aggregation

Chanwoo Park, Mingyang Liu, Dingwen Kong, Kaiqing Zhang, Asuman Ozdaglar

专题命中 偏好对齐 :RLHF(title,abstract);分类 cs.AI、cs.LG

Comments Added experiments

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.12900 2024-05-22 cs.CL cs.AI 81%

Adversarial DPO: Harnessing Harmful Data for Reducing Toxicity with Minimal Impact on Coherence and Evasiveness in Dialogue Agents

San Kim, Gary Geunbae Lee

专题命中 偏好对齐 :DPO(title,abstract);分类 cs.CL、cs.AI

Comments 15 pages, 7 figures, accepted to NAACL findings 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.00409 2024-04-15 cs.LG cs.CL 81%

Provably Robust DPO: Aligning Language Models with Noisy Feedback

Sayak Ray Chowdhury, Anush Kini, Nagarajan Natarajan

专题命中 偏好对齐 :DPO(title,abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏