arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 3278 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 3278 篇

2402.12174 2024-05-31 cs.CL 57%

BIDER: Bridging Knowledge Inconsistency for Efficient Retrieval-Augmented LLMs via Key Supporting Evidence

Jiajie Jin, Yutao Zhu, Yujia Zhou, Zhicheng Dou

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

Comments Accepted by ACL 2024 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.02054 2024-05-30 cs.CL 57%

Deconstructing In-Context Learning: Understanding Prompts via Corruption

Namrata Shivagunde, Vladislav Lialin, Sherin Muckatira, Anna Rumshisky

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

Comments Accepted to LREC-COLING 2024 main conference. The code is available at https://github.com/text-machine-lab/Understanding_prompts_via_corruption

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.10505 2024-05-17 cs.LG 57%

ReMax: A Simple, Effective, and Efficient Reinforcement Learning Method for Aligning Large Language Models

Ziniu Li, Tian Xu, Yushun Zhang, Zhihang Lin, Yang Yu, Ruoyu Sun, Zhi-Quan Luo

专题命中 偏好对齐 :RLHF(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.00394 2024-05-02 cs.GT cs.LG 57%

Enhancing Mutual Trustworthiness in Federated Learning for Data-Rich Smart Cities

Osama Wehbi, Sarhad Arisdakessian, Mohsen Guizani, Omar Abdel Wahab, Azzam Mourad, Hadi Otrok, Hoda Al khzaimi, Bassem Ouni

专题命中 偏好对齐 :trustworthy(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.01197 2024-04-30 cs.CL 57%

DMoERM: Recipes of Mixture-of-Experts for Effective Reward Modeling

Shanghaoran Quan

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

Comments 23 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.09089 2024-04-18 cs.CL 57%

Qilin-Med: Multi-stage Knowledge Injection Advanced Medical Large Language Model

Qichen Ye, Junling Liu, Dading Chong, Peilin Zhou, Yining Hua, Fenglin Liu, Meng Cao, Ziming Wang, Xuxin Cheng, Zhu Lei, Zhenhua Guo

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.09990 2024-04-16 cs.CV cs.AI 57%

HQ-Edit: A High-Quality Dataset for Instruction-based Image Editing

Mude Hui, Siwei Yang, Bingchen Zhao, Yichun Shi, Heng Wang, Peng Wang, Yuyin Zhou, Cihang Xie

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI

Comments Project Page: https://thefllood.github.io/HQEdit_web

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.08380 2024-04-15 cs.CL 57%

Direct Preference Optimization for Neural Machine Translation with Minimum Bayes Risk Decoding

Guangyu Yang, Jinghong Chen, Weizhe Lin, Bill Byrne

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL

Comments To appear at NAACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.02893 2024-04-04 cs.CL 57%

ChatGLM-Math: Improving Math Problem-Solving in Large Language Models with a Self-Critique Pipeline

Yifan Xu, Xiao Liu, Xinghan Liu, Zhenyu Hou, Yueyan Li, Xiaohan Zhang, Zihan Wang, Aohan Zeng, Zhengxiao Du, Wenyi Zhao, Jie Tang, Yuxiao Dong

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.09798 2024-03-18 cs.CY 57%

Comparing Rationality Between Large Language Models and Humans: Insights and Open Questions

Dana Alsagheer, Rabimba Karanjai, Nour Diallo, Weidong Shi, Yang Lu, Suha Beydoun, Qiaoning Zhang

专题命中 偏好对齐 :RLHF(abstract);分类 cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.06735 2024-03-12 cs.CV cs.AI 57%

Enhancing Image Caption Generation Using Reinforcement Learning with Human Feedback

Adarsh N L, Arun P, Aravindh N L

专题命中 偏好对齐 :RLHF(abstract);分类 cs.AI

Comments 6 Pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.02743 2024-03-12 cs.LG 57%

Reward Model Ensembles Help Mitigate Overoptimization

Thomas Coste, Usman Anwar, Robert Kirk, David Krueger

专题命中 偏好对齐 :RLHF(abstract);分类 cs.LG

Comments Accepted at ICLR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.04642 2024-03-08 cs.LG 57%

Teaching Large Language Models to Reason with Reinforcement Learning

Alex Havrilla, Yuqing Du, Sharath Chandra Raparthy, Christoforos Nalmpantis, Jane Dwivedi-Yu, Maksym Zhuravinskyi, Eric Hambro, Sainbayar Sukhbaatar, Roberta Raileanu

专题命中 偏好对齐 :RLHF(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.15754 2024-02-27 cs.CL 57%

HD-Eval: Aligning Large Language Model Evaluators Through Hierarchical Criteria Decomposition

Yuxuan Liu, Tianchi Yang, Shaohan Huang, Zihan Zhang, Haizhen Huang, Furu Wei, Weiwei Deng, Feng Sun, Qi Zhang

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

Comments 20 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.13113 2024-02-27 cs.AI cs.IT cs.MA math.IT q-bio.NC 57%

Interactive inference: a multi-agent model of cooperative joint actions

Domenico Maisto, Francesco Donnarumma, Giovanni Pezzulo

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI

Comments 32 pages, 16 figures

Journal ref IEEE Transactions on Systems, Man, and Cybernetics: Systems Volume: 54, Issue: 2, February 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.14791 2024-02-26 cs.CL 57%

Prompting Large Language Models for Counterfactual Generation: An Empirical Study

Yongqi Li, Mayi Xu, Xin Miao, Shen Zhou, Tieyun Qian

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

Comments Accepted to LREC-COLING 2024, camera ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.01045 2024-02-13 cs.CL 57%

Tool-Augmented Reward Modeling

Lei Li, Yekun Chai, Shuohuan Wang, Yu Sun, Hao Tian, Ningyu Zhang, Hua Wu

专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL

Comments ICLR 2024 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.04076 2024-02-07 cs.CL 57%

Do LLMs exhibit human-like response biases? A case study in survey design

Lindia Tjuatja, Valerie Chen, Sherry Tongshuang Wu, Ameet Talwalkar, Graham Neubig

专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.02054 2024-02-06 cs.AI 57%

AlignDiff: Aligning Diverse Human Preferences via Behavior-Customisable Diffusion Model

Zibin Dong, Yifu Yuan, Jianye Hao, Fei Ni, Yao Mu, Yan Zheng, Yujing Hu, Tangjie Lv, Changjie Fan, Zhipeng Hu

专题命中 偏好对齐 :RLHF(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.00782 2024-02-02 cs.LG 57%

Dense Reward for Free in Reinforcement Learning from Human Feedback

Alex J. Chan, Hao Sun, Samuel Holt, Mihaela van der Schaar

专题命中 偏好对齐 :RLHF(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.00744 2024-02-02 cs.SD cs.CL eess.AS 57%

BATON: Aligning Text-to-Audio Model with Human Preference Feedback

Huan Liao, Haonan Han, Kai Yang, Tianjiao Du, Rui Yang, Zunnan Xu, Qinmei Xu, Jingquan Liu, Jiasheng Lu, Xiu Li

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.14422 2024-02-02 cs.CL 57%

Large Language Models are biased to overestimate profoundness

Eugenio Herrera-Berg, Tomás Vergara Browne, Pablo León-Villagrá, Marc-Lluís Vives, Cristian Buc Calderon

专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL

Comments 5 pages, 3 figures

Journal ref https://aclanthology.org/2023.emnlp-main.599

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.05782 2024-01-17 cs.CL 57%

Aligning Language Models with Human Preferences via a Bayesian Approach

Jiashuo Wang, Haozhao Wang, Shichao Sun, Wenjie Li

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

Comments NeurIPS 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.02072 2024-01-05 cs.CL 57%

ICE-GRT: Instruction Context Enhancement by Generative Reinforcement based Transformers

Chen Zheng, Ke Sun, Da Tang, Yukun Ma, Yuyu Zhang, Chenguang Xi, Xun Zhou

专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.00243 2024-01-02 cs.LG 57%

Uncertainty-Penalized Reinforcement Learning from Human Feedback with Diverse Reward LoRA Ensembles

Yuanzhao Zhai, Han Zhang, Yu Lei, Yue Yu, Kele Xu, Dawei Feng, Bo Ding, Huaimin Wang

专题命中 偏好对齐 :RLHF(abstract);分类 cs.LG

Comments 10 pages, 5 figures,

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.14550 2024-01-02 cs.AI 57%

ReMAV: Reward Modeling of Autonomous Vehicles for Finding Likely Failure Events

Aizaz Sharif, Dusica Marijan

专题命中 偏好对齐 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.15907 2023-12-27 cs.CL 57%

Align on the Fly: Adapting Chatbot Behavior to Established Norms

Chunpu Xu, Steffi Chern, Ethan Chern, Ge Zhang, Zekun Wang, Ruibo Liu, Jing Li, Jie Fu, Pengfei Liu

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.10420 2023-12-27 cs.CL 57%

A Comprehensive Capability Analysis of GPT-3 and GPT-3.5 Series Models

Junjie Ye, Xuanting Chen, Nuo Xu, Can Zu, Zekai Shao, Shichun Liu, Yuhan Cui, Zeyang Zhou, Chao Gong, Yang Shen, Jie Zhou, Siming Chen, Tao Gui, Qi Zhang, Xuanjing Huang

专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.10665 2023-12-19 cs.CV cs.CL 57%

Silkie: Preference Distillation for Large Visual Language Models

Lei Li, Zhihui Xie, Mukai Li, Shunian Chen, Peiyi Wang, Liang Chen, Yazheng Yang, Benyou Wang, Lingpeng Kong

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL

Comments Project page: https://vlf-silkie.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.01003 2023-12-19 cs.CV cs.CL 57%

Visual Instruction Tuning with Polite Flamingo

Delong Chen, Jianfeng Liu, Wenliang Dai, Baoyuan Wang

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

Comments In AAAI-24

详情

展开后加载摘要…

URL PDF HTML 收藏