arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 3278 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 3278 篇

2310.13595 2023-11-29 cs.CY 57%

The History and Risks of Reinforcement Learning and Human Feedback

Nathan Lambert, Thomas Krendl Gilbert, Tom Zick

专题命中 偏好对齐 :RLHF(abstract);分类 cs.CY

Comments 14 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.10702 2023-11-21 cs.CL 57%

Camels in a Changing Climate: Enhancing LM Adaptation with Tulu 2

Hamish Ivison, Yizhong Wang, Valentina Pyatkin, Nathan Lambert, Matthew Peters, Pradeep Dasigi, Joel Jang, David Wadden, Noah A. Smith, Iz Beltagy, Hannaneh Hajishirzi

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL

Comments technical report; fixed zephyr numbers

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.05821 2023-11-13 cs.CL 57%

Let's Reinforce Step by Step

Sarah Pan, Vladislav Lialin, Sherin Muckatira, Anna Rumshisky

专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL

Comments NeurIPS 2023 Workshop on Instruction Tuning and Instruction Following

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.00953 2023-11-03 cs.CL 57%

Blending Reward Functions via Few Expert Demonstrations for Faithful and Accurate Knowledge-Grounded Dialogue Generation

Wanyu Du, Yangfeng Ji

专题命中 偏好对齐 :trustworthy(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.01693 2023-10-31 cs.CL 57%

Fine-Grained Human Feedback Gives Better Rewards for Language Model Training

Zeqiu Wu, Yushi Hu, Weijia Shi, Nouha Dziri, Alane Suhr, Prithviraj Ammanabrolu, Noah A. Smith, Mari Ostendorf, Hannaneh Hajishirzi

专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL

Comments NeurIPS 2023 camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.16681 2023-10-26 cs.CL 57%

BabyStories: Can Reinforcement Learning Teach Baby Language Models to Write Better Stories?

Xingmeng Zhao, Tongnian Wang, Sheri Osborn, Anthony Rios

专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL

Comments Accepted to BabyLM workshop at CoNLL

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.09968 2023-10-17 cs.CL 57%

On Improving Summarization Factual Consistency from Natural Language Feedback

Yixin Liu, Budhaditya Deb, Milagro Teruel, Aaron Halfaker, Dragomir Radev, Ahmed H. Awadallah

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

Comments ACL 2023 Camera Ready, GitHub Repo: https://github.com/microsoft/DeFacto

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.13308 2023-09-26 cs.CL 57%

Calibrating LLM-Based Evaluator

Yuxuan Liu, Tianchi Yang, Shaohan Huang, Zihan Zhang, Haizhen Huang, Furu Wei, Weiwei Deng, Feng Sun, Qi Zhang

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

Comments 22 pages,11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.13094 2023-09-26 cs.GL cs.AI 57%

Computational Natural Philosophy: A Thread from Presocratics through Turing to ChatGPT

Gordana Dodig-Crnkovic

专题命中 偏好对齐 :RLHF(abstract);分类 cs.AI

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.01659 2023-09-06 cs.SI cs.CL 57%

Evolving linguistic divergence on polarizing social media

Andres Karjus, Christine Cuskley

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.16529 2023-09-01 cs.RO cs.AI cs.HC 57%

Developing Social Robots with Empathetic Non-Verbal Cues Using Large Language Models

Yoon Kyung Lee, Yoonwon Jung, Gyuyi Kang, Sowon Hahn

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI

Journal ref In Proceedings of 2023 IEEE International Conference on Robot & Human Interactive Communication (RO-MAN)

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.01852 2023-08-25 cs.CL 57%

Summary of ChatGPT-Related Research and Perspective Towards the Future of Large Language Models

Yiheng Liu, Tianle Han, Siyuan Ma, Jiayue Zhang, Yuanyuan Yang, Jiaming Tian, Hao He, Antong Li, Mengshen He, Zhengliang Liu, Zihao Wu, Lin Zhao, Dajiang Zhu, Xiang Li, Ning Qiang, Dingang Shen, Tianming Liu, Bao Ge

专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL

Comments 21 pages, 4 figures, accepted by Meta-Radiology

Journal ref Meta-Radiology (2023)100017

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.00360 2023-08-16 cs.CL 57%

BatGPT: A Bidirectional Autoregessive Talker from Generative Pre-trained Transformer

Zuchao Li, Shitou Zhang, Hai Zhao, Yifei Yang, Dongjie Yang

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.02223 2023-08-07 cs.CL 57%

ESRL: Efficient Sampling-based Reinforcement Learning for Sequence Generation

Chenglong Wang, Hang Zhou, Yimin Hu, Yifu Huo, Bei Li, Tongran Liu, Tong Xiao, Jingbo Zhu

专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.12966 2023-07-25 cs.CL 57%

Aligning Large Language Models with Human: A Survey

Yufei Wang, Wanjun Zhong, Liangyou Li, Fei Mi, Xingshan Zeng, Wenyong Huang, Lifeng Shang, Xin Jiang, Qun Liu

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

Comments work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.05532 2023-07-13 cs.CL 57%

Opening up ChatGPT: Tracking openness, transparency, and accountability in instruction-tuned text generators

Andreas Liesenfeld, Alianda Lopez, Mark Dingemanse

专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.04349 2023-06-09 cs.CL cs.DB 57%

GPT Self-Supervision for a Better Data Annotator

Xiaohuan Pei, Yanxi Li, Chang Xu

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.13324 2023-04-27 cs.AI cs.HC 57%

A Portrait of Emotion: Empowering Self-Expression through AI-Generated Art

Yoon Kyung Lee, Yong-Ha Park, Sowon Hahn

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI

Comments Accepted CogSci 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.05332 2023-04-12 physics.chem-ph cs.CL 57%

Emergent autonomous scientific research capabilities of large language models

Daniil A. Boiko, Robert MacKnight, Gabe Gomes

专题命中 偏好对齐 :safety(abstract);分类 cs.CL

Comments Version 1, April 11, 2023. 48 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.07459 2023-02-21 cs.CL 57%

The Capacity for Moral Self-Correction in Large Language Models

Deep Ganguli, Amanda Askell, Nicholas Schiefer, Thomas I. Liao, Kamilė Lukošiūtė, Anna Chen, Anna Goldie, Azalia Mirhoseini, Catherine Olsson, Danny Hernandez, Dawn Drain, Dustin Li, Eli Tran-Johnson, Ethan Perez, Jackson Kernion, Jamie Kerr, Jared Mueller, Joshua Landau, Kamal Ndousse, Karina Nguyen, Liane Lovitt, Michael Sellitto, Nelson Elhage, Noemi Mercado, Nova DasSarma, Oliver Rausch, Robert Lasenby, Robin Larson, Sam Ringer, Sandipan Kundu, Saurav Kadavath, Scott Johnston, Shauna Kravec, Sheer El Showk, Tamera Lanham, Timothy Telleen-Lawton, Tom Henighan, Tristan Hume, Yuntao Bai, Zac Hatfield-Dodds, Ben Mann, Dario Amodei, Nicholas Joseph, Sam McCandlish, Tom Brown, Christopher Olah, Jack Clark, Samuel R. Bowman, Jared Kaplan

专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.10107 2023-01-25 cs.AI cs.GT cs.HC 57%

Story Shaping: Teaching Agents Human-like Behavior with Stories

Xiangyu Peng, Christopher Cui, Wei Zhou, Renee Jia, Mark Riedl

专题命中 偏好对齐 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.08144 2023-01-20 cs.IR cs.AI cs.HC 57%

Towards the design of user-centric strategy recommendation systems for collaborative Human-AI tasks

Lakshita Dodeja, Pradyumna Tambwekar, Erin Hedlund-Botti, Matthew Gombolay

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.11602 2022-11-22 cs.LG cs.HC cs.MA 57%

Improving Multimodal Interactive Agents with Reinforcement Learning from Human Feedback

Josh Abramson, Arun Ahuja, Federico Carnevale, Petko Georgiev, Alex Goldin, Alden Hung, Jessica Landon, Jirka Lhotka, Timothy Lillicrap, Alistair Muldal, George Powell, Adam Santoro, Guy Scully, Sanjana Srivastava, Tamara von Glehn, Greg Wayne, Nathaniel Wong, Chen Yan, Rui Zhu

专题命中 偏好对齐 :RLHF(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.10760 2022-10-20 cs.LG stat.ML 57%

Scaling Laws for Reward Model Overoptimization

Leo Gao, John Schulman, Jacob Hilton

专题命中 偏好对齐 :alignment(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2208.14165 2022-08-31 cs.CL 57%

Towards Boosting the Open-Domain Chatbot with Human Feedback

Hua Lu, Siqi Bao, Huang He, Fan Wang, Hua Wu, Haifeng Wang

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

Comments First two authors contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2107.08946 2022-04-28 cs.CY cs.HC 57%

Using automated decision-making (ADM) to allocate Covid-19 vaccinations? Exploring the roles of trust and social group preference on the legitimacy of ADM vs. human decision-making

Marco Lünich, Kimon Kieslich

专题命中 偏好对齐 :trustworthy(abstract);分类 cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2003.07745 2020-03-18 cs.AI cs.RO 57%

Learning to Optimize Autonomy in Competence-Aware Systems

Connor Basich, Justin Svegliato, Kyle Hollins Wray, Stefan Witwicki, Joydeep Biswas, Shlomo Zilberstein

专题命中 偏好对齐 :safety(abstract);分类 cs.AI

Comments To be published in Proceedings of the 19th International Conference on Autonomous Agents and Multiagent Systems (AAMAS 2020). 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
1910.07615 2019-10-18 cs.RO cs.AI cs.CV 57%

Conditional Driving from Natural Language Instructions

Junha Roh, Chris Paxton, Andrzej Pronobis, Ali Farhadi, Dieter Fox

专题命中 偏好对齐 :safety(abstract);分类 cs.AI

Comments Accepted by the 3rd Conference on Robot Learning, Osaka, Japan (CoRL 2019)

详情

展开后加载摘要…

URL PDF HTML 收藏
1910.03704 2019-10-10 cs.CL cs.IT cs.PL math.IT 57%

Do People Prefer "Natural" code?

Casey Casalnuovo, Kevin Lee, Hulin Wang, Prem Devanbu, Emily Morgan

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
1809.05781 2018-09-18 cs.LG stat.ML 57%

Modelling Latent Travel Behaviour Characteristics with Generative Machine Learning

Melvin Wong, Bilal Farooq

专题命中 偏好对齐 :safety(abstract);分类 cs.LG

Comments Published in the proceedings of IEEE Intelligent Transportation Systems Conference 2018

详情

展开后加载摘要…

URL PDF HTML 收藏