arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 3278 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 3278 篇

2403.09720 2024-03-18 cs.CL cs.AI 62%

Fine-tuning vs Prompting, Can Language Models Understand Human Values?

Pingwei Sun

专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.07708 2024-03-15 cs.CL cs.AI 62%

Improving Reinforcement Learning from Human Feedback Using Contrastive Rewards

Wei Shen, Xiaoying Zhang, Yuanshun Yao, Rui Zheng, Hongyi Guo, Yang Liu

专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.07691 2024-03-15 cs.CL cs.AI 62%

ORPO: Monolithic Preference Optimization without Reference Model

Jiwoo Hong, Noah Lee, James Thorne

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.04132 2024-03-08 cs.AI cs.CL 62%

Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference

Wei-Lin Chiang, Lianmin Zheng, Ying Sheng, Anastasios Nikolas Angelopoulos, Tianle Li, Dacheng Li, Hao Zhang, Banghua Zhu, Michael Jordan, Joseph E. Gonzalez, Ion Stoica

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.00830 2024-03-05 cs.AI cs.CL 62%

MedAide: Leveraging Large Language Models for On-Premise Medical Assistance on Edge Devices

Abdul Basit, Khizar Hussain, Muhammad Abdullah Hanif, Muhammad Shafique

专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL、cs.AI

Comments 7 pages, 11 figures, ACM conference paper, 33 references

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.00131 2024-02-23 cs.CL cs.AI 62%

Underspecification in Language Modeling Tasks: A Causality-Informed Study of Gendered Pronoun Resolution

Emily McMilin

专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL、cs.AI

Comments 24 pages, 41 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.08078 2024-02-14 cs.CL cs.LG 62%

Large Language Models as Agents in Two-Player Games

Yang Liu, Peng Sun, Hang Li

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.12292 2024-02-01 cs.CL cs.AI 62%

GRATH: Gradual Self-Truthifying for Large Language Models

Weixin Chen, Dawn Song, Bo Li

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.10882 2024-01-22 cs.CL cs.AI cs.HC 62%

Reinforcement learning for question answering in programming domain using public community scoring as a human feedback

Alexey Gorbatovski, Sergey Kovalchuk

专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.02870 2024-01-08 cs.MA cs.AI cs.CL 62%

AFSPP: Agent Framework for Shaping Preference and Personality with Large Language Models

Zihong He, Changwang Zhang

专题命中 偏好对齐 :trustworthy(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.13301 2024-01-08 cs.LG cs.AI cs.CV 62%

Training Diffusion Models with Reinforcement Learning

Kevin Black, Michael Janner, Yilun Du, Ilya Kostrikov, Sergey Levine

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI、cs.LG

Comments 23 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.12050 2023-12-12 cs.CL cs.AI 62%

Aligning Language Models with Offline Learning from Human Feedback

Jian Hu, Li Tao, June Yang, Chandler Zhou

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.02206 2023-12-06 cs.AI cs.CL 62%

Axiomatic Preference Modeling for Longform Question Answering

Corby Rosset, Guoqing Zheng, Victor Dibia, Ahmed Awadallah, Paul Bennett

专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL、cs.AI

Comments Accepted to EMNLP 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.00416 2023-11-02 cs.LG cs.CL 62%

Efficient Human-AI Coordination via Preparatory Language-based Convention

Cong Guan, Lichao Zhang, Chunpeng Fan, Yichen Li, Feng Chen, Lihe Li, Yunjia Tian, Lei Yuan, Yang Yu

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.07123 2023-10-17 cs.LG cs.AI 62%

Off-Policy Evaluation for Human Feedback

Qitong Gao, Ge Gao, Juncheng Dong, Vahid Tarokh, Min Chi, Miroslav Pajic

专题命中 偏好对齐 :safety(abstract);分类 cs.AI、cs.LG

Comments Accepted to NeurIPS 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.05914 2023-10-11 cs.CL cs.LG 62%

NEFTune: Noisy Embeddings Improve Instruction Finetuning

Neel Jain, Ping-yeh Chiang, Yuxin Wen, John Kirchenbauer, Hong-Min Chu, Gowthami Somepalli, Brian R. Bartoldson, Bhavya Kailkhura, Avi Schwarzschild, Aniruddha Saha, Micah Goldblum, Jonas Geiping, Tom Goldstein

专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL、cs.LG

Comments 25 pages, Code is available on Github: https://github.com/neelsjain/NEFTune

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.02456 2023-10-05 cs.LG cs.AI 62%

Learning Optimal Advantage from Preferences and Mistaking it for Reward

W. Bradley Knox, Stephane Hatgis-Kessell, Sigurdur Orn Adalgeirsson, Serena Booth, Anca Dragan, Peter Stone, Scott Niekum

专题命中 偏好对齐 :RLHF(abstract);分类 cs.AI、cs.LG

Comments 8 pages (16 pages with references and appendix), 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.11166 2023-09-28 cs.CL cs.AI 62%

Are Large Language Models Really Robust to Word-Level Perturbations?

Haoyu Wang, Guozheng Ma, Cong Yu, Ning Gui, Linrui Zhang, Zhiqi Huang, Suwei Ma, Yongzhe Chang, Sen Zhang, Li Shen, Xueqian Wang, Peilin Zhao, Dacheng Tao

专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.03224 2023-09-13 cs.AI cs.LG 62%

No Train Still Gain. Unleash Mathematical Reasoning of Large Language Models with Monte Carlo Tree Search Guided by Energy Function

Haotian Xu

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI、cs.LG

Comments still in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.08998 2023-08-22 cs.CL cs.LG 62%

Reinforced Self-Training (ReST) for Language Modeling

Caglar Gulcehre, Tom Le Paine, Srivatsan Srinivasan, Ksenia Konyushkova, Lotte Weerts, Abhishek Sharma, Aditya Siddhant, Alex Ahern, Miaosen Wang, Chenjie Gu, Wolfgang Macherey, Arnaud Doucet, Orhan Firat, Nando de Freitas

专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL、cs.LG

Comments 23 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.16039 2023-08-03 cs.CL cs.LG 62%

Okapi: Instruction-tuned Large Language Models in Multiple Languages with Reinforcement Learning from Human Feedback

Viet Dac Lai, Chien Van Nguyen, Nghia Trung Ngo, Thuat Nguyen, Franck Dernoncourt, Ryan A. Rossi, Thien Huu Nguyen

专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.10512 2023-07-21 cs.CL cs.AI 62%

IvyGPT: InteractiVe Chinese pathwaY language model in medical domain

Rongsheng Wang, Yaofei Duan, ChanTong Lam, Jiexi Chen, Jiangsheng Xu, Haoming Chen, Xiaohong Liu, Patrick Cheong-Iao Pang, Tao Tan

专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL、cs.AI

Comments 5 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.08582 2023-06-16 cs.CL cs.LG 62%

Pretraining Language Models with Human Preferences

Tomasz Korbak, Kejian Shi, Angelica Chen, Rasika Bhalerao, Christopher L. Buckley, Jason Phang, Samuel R. Bowman, Ethan Perez

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.LG

Comments ICML 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.09363 2023-06-06 cs.CL cs.AI cs.IR 62%

Towards Unified Conversational Recommender Systems via Knowledge-Enhanced Prompt Learning

Xiaolei Wang, Kun Zhou, Ji-Rong Wen, Wayne Xin Zhao

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI

Comments Accepted by KDD 2022. Code: https://github.com/RUCAIBox/UniCRS

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.15541 2023-05-26 cs.CL cs.AI 62%

Harnessing the Power of Large Language Models for Natural Language to First-Order Logic Translation

Yuan Yang, Siheng Xiong, Ali Payani, Ehsan Shareghi, Faramarz Fekri

专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.10425 2023-05-18 cs.CL cs.AI 62%

SLiC-HF: Sequence Likelihood Calibration with Human Feedback

Yao Zhao, Rishabh Joshi, Tianqi Liu, Misha Khalman, Mohammad Saleh, Peter J. Liu

专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.07036 2023-05-15 cs.LG cs.AI 62%

GFlowNets with Human Feedback

Yinchuan Li, Shuang Luo, Yunfeng Shao, Jianye Hao

专题命中 偏好对齐 :RLHF(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.11490 2023-04-27 cs.AI cs.CL 62%

Boosting Theory-of-Mind Performance in Large Language Models via Prompting

Shima Rahimi Moghaddam, Christopher J. Honey

专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL、cs.AI

Comments 27 pages, 4 main figures, 2 supplementary figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.15906 2023-03-01 cs.AI cs.HC cs.LG 62%

Relative Behavioral Attributes: Filling the Gap between Symbolic Goal Specification and Reward Learning from Human Preferences

Lin Guan, Karthik Valmeekam, Subbarao Kambhampati

专题命中 偏好对齐 :RLHF(abstract);分类 cs.AI、cs.LG

Comments ICLR 2023 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.10291 2023-02-22 cs.CL cs.LG 62%

Can Large Language Models Change User Preference Adversarially?

Varshini Subhash

专题命中 偏好对齐 :red teaming(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏