arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 3273 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 3273 篇

2411.15382 2025-04-01 cs.CL 70%

On the Impact of Fine-Tuning on Chain-of-Thought Reasoning

Elita Lobo, Chirag Agarwal, Himabindu Lakkaraju

专题命中 偏好对齐 :RLHF(abstract);safety(abstract);分类 cs.CL

Comments This paper is a work in progress with findings based on limited evidence. Please exercise discretion when interpreting the findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15129 2025-03-20 cs.AI 70%

Aligning Crowd-sourced Human Feedback for Reinforcement Learning on Code Generation by Large Language Models

Man Fai Wong, Chee Wei Tan

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14391 2025-03-19 cs.CL 70%

How much do LLMs learn from negative examples?

Shadi Hamdan, Deniz Yuret

专题命中 偏好对齐 :RLHF(abstract);DPO(abstract);分类 cs.CL

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14189 2025-03-19 cs.CL cs.CV 70%

Towards Harmless Multimodal Assistants with Blind Preference Optimization

Yongqi Li, Lu Yang, Jian Wang, Runyang You, Wenjie Li, Liqiang Nie

专题命中 偏好对齐 :DPO(abstract);safety(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10215 2025-03-14 cs.AI cs.GT 70%

Adaptive Preference Aggregation

Benjamin Heymann

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01076 2025-03-04 cs.LG stat.ML 70%

Active Learning for Direct Preference Optimization

Branislav Kveton, Xintong Li, Julian McAuley, Ryan Rossi, Jingbo Shang, Junda Wu, Tong Yu

专题命中 偏好对齐 :RLHF(abstract);DPO(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.17401 2025-03-04 cs.LG stat.ML 70%

Zeroth-Order Policy Gradient for Reinforcement Learning from Human Feedback without Reward Inference

Qining Zhang, Lei Ying

专题命中 偏好对齐 :RLHF(abstract);DPO(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19798 2025-02-28 cs.AI 70%

Developmental Support Approach to AI's Autonomous Growth: Toward the Realization of a Mutually Beneficial Stage Through Experiential Learning

Taichiro Endo

专题命中 偏好对齐 :alignment(abstract);DPO(abstract);分类 cs.AI

Comments 4pages, 3 figures

Journal ref Proc. 1st Workshop on Post-Singularity Symbiosis, PSS-2025-007, March 3, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.07471 2025-02-19 cs.CL 70%

Bridging and Modeling Correlations in Pairwise Data for Direct Preference Optimization

Yuxin Jiang, Bo Huang, Yufei Wang, Xingshan Zeng, Liangyou Li, Yasheng Wang, Xin Jiang, Lifeng Shang, Ruiming Tang, Wei Wang

专题命中 偏好对齐 :alignment(abstract);DPO(abstract);分类 cs.CL

Comments 20 pages, 9 figures, 12 tables. Accepted at ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.02302 2025-02-19 cs.CL 70%

Towards Human Understanding of Paraphrase Types in Large Language Models

Dominik Meier, Jan Philip Wahle, Terry Ruas, Bela Gipp

专题命中 偏好对齐 :RLHF(abstract);DPO(abstract);分类 cs.CL

Journal ref Proceedings of the 31st International Conference on Computational Linguistics (2025), pages 6298-6316

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.21545 2025-02-19 cs.CL 70%

CARMO: Dynamic Criteria Generation for Context-Aware Reward Modelling

Taneesh Gupta, Shivam Shandilya, Xuchao Zhang, Rahul Madhavan, Supriyo Ghosh, Chetan Bansal, Huaxiu Yao, Saravan Rajmohan

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.00847 2025-02-13 cs.LG 70%

Uncertainty-aware Reward Model: Teaching Reward Models to Know What is Unknown

Xingzhou Lou, Dong Yan, Wei Shen, Yuzi Yan, Jian Xie, Junge Zhang

专题命中 偏好对齐 :alignment(abstract);DPO(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.08770 2025-02-12 cs.AI 70%

Model Surgery: Modulating LLM's Behavior Via Simple Parameter Editing

Huanqian Wang, Yang Yue, Rui Lu, Jingxin Shi, Andrew Zhao, Shenzhi Wang, Shiji Song, Gao Huang

专题命中 偏好对齐 :RLHF(abstract);jailbreak(abstract);分类 cs.AI

Comments 23 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.18457 2025-02-11 cs.CL 70%

CALM: Unleashing the Cross-Lingual Self-Aligning Ability of Language Model Question Answering

Yumeng Wang, Zhiyuan Fan, Qingyun Wang, May Fung, Heng Ji

专题命中 偏好对齐 :alignment(abstract);DPO(abstract);分类 cs.CL

Comments Accepted by NAACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.18663 2025-02-03 cs.CR cs.AI 70%

Joint Optimization of Prompt Security and System Performance in Edge-Cloud LLM Systems

Haiyang Huang, Tianhui Meng, Weijia Jia

专题命中 偏好对齐 :RLHF(abstract);safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.01158 2025-01-28 cs.CL 70%

Learning to Explore and Select for Coverage-Conditioned Retrieval-Augmented Generation

Takyoung Kim, Kyungjae Lee, Young Rok Jang, Ji Yong Cho, Gangwoo Kim, Minseok Cho, Moontae Lee

专题命中 偏好对齐 :alignment(abstract);DPO(abstract);分类 cs.CL

Comments NAACL 2025 (Findings, Long). Resources are available at https://github.com/youngerous/qtree

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.07888 2025-01-27 cs.CV cs.AI 70%

Tarsier2: Advancing Large Vision-Language Models from Detailed Video Description to Comprehensive Video Understanding

Liping Yuan, Jiawei Wang, Haomiao Sun, Yuchen Zhang, Yuan Lin

专题命中 偏好对齐 :alignment(abstract);DPO(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.14436 2025-01-22 cs.RO cs.LG 70%

REBEL: Reward Regularization-Based Approach for Robotic Reinforcement Learning from Human Feedback

Souradip Chakraborty, Anukriti Singh, Amisha Bhaskar, Pratap Tokekar, Dinesh Manocha, Amrit Singh Bedi

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01336 2025-01-03 cs.CL 70%

Aligning Large Language Models for Faithful Integrity Against Opposing Argument

Yong Zhao, Yang Deng, See-Kiong Ng, Tat-Seng Chua

专题命中 偏好对齐 :alignment(abstract);DPO(abstract);分类 cs.CL

Comments 17 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.02504 2025-01-03 stat.ML cs.LG 70%

Dual Active Learning for Reinforcement Learning from Human Feedback

Pangpang Liu, Chengchun Shi, Will Wei Sun

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.15650 2024-12-23 cs.LG 70%

Beyond Human Data: Aligning Multimodal Large Language Models by Iterative Self-Evolution

Wentao Tan, Qiong Cao, Yibing Zhan, Chao Xue, Changxing Ding

专题命中 偏好对齐 :alignment(abstract);DPO(abstract);分类 cs.LG

Comments AAAI 2025. The code is available at https://github.com/WentaoTan/SENA

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.15156 2024-12-20 cs.CV cs.CL cs.MM 70%

Prompt-A-Video: Prompt Your Video Diffusion Model via Preference-Aligned LLM

Yatai Ji, Jiacheng Zhang, Jie Wu, Shilong Zhang, Shoufa Chen, Chongjian GE, Peize Sun, Weifeng Chen, Wenqi Shao, Xuefeng Xiao, Weilin Huang, Ping Luo

专题命中 偏好对齐 :alignment(abstract);DPO(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.01766 2024-12-20 cs.CL cs.AI cs.CY cs.LG econ.GN q-fin.EC 70%

LLM Voting: Human Choices and AI Collective Decision Making

Joshua C. Yang, Damian Dailisan, Marcin Korecki, Carina I. Hausladen, Dirk Helbing

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

Comments Accepted in AAAI Conference on AI, Ethics, and Society (AIES)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.12865 2024-12-18 cs.CL 70%

Preference-Oriented Supervised Fine-Tuning: Favoring Target Model Over Aligned Large Language Models

Yuchen Fan, Yuzhong Hong, Qiushi Wang, Junwei Bao, Hongfei Jiang, Yang Song

专题命中 偏好对齐 :alignment(abstract);DPO(abstract);分类 cs.CL

Comments AAAI2025, 12 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.07667 2024-12-17 cs.CR cs.CL 70%

Simulate and Eliminate: Revoke Backdoors for Generative Large Language Models

Haoran Li, Yulin Chen, Zihao Zheng, Qi Hu, Chunkit Chan, Heshan Liu, Yangqiu Song

专题命中 偏好对齐 :RLHF(abstract);safety(abstract);分类 cs.CL

Comments To appear at AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.01304 2024-12-13 cs.CL 70%

Improving the Validity of Automatically Generated Feedback via Reinforcement Learning

Alexander Scarlatos, Digory Smith, Simon Woodhead, Andrew Lan

专题命中 偏好对齐 :alignment(abstract);DPO(abstract);分类 cs.CL

Comments Best student paper award, Published in AIED 2024: The 25th International Conference on Artificial Intelligence in Education

Journal ref In International Conference on Artificial Intelligence in Education (pp. 280-294). Cham: Springer Nature Switzerland (2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.09215 2024-11-08 cs.IR cs.AI 70%

On Softmax Direct Preference Optimization for Recommendation

Yuxin Chen, Junfei Tan, An Zhang, Zhengyi Yang, Leheng Sheng, Enzhi Zhang, Xiang Wang, Tat-Seng Chua

专题命中 偏好对齐 :alignment(abstract);DPO(abstract);分类 cs.AI

Comments NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.17977 2024-11-06 cs.CL 70%

Aligning to Thousands of Preferences via System Message Generalization

Seongyun Lee, Sue Hyun Park, Seungone Kim, Minjoon Seo

专题命中 偏好对齐 :alignment(abstract);harmlessness(abstract);分类 cs.CL

Comments Accepted to NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.20290 2024-11-04 cs.CL 70%

Fast Best-of-N Decoding via Speculative Rejection

Hanshi Sun, Momin Haider, Ruiqi Zhang, Huitao Yang, Jiahao Qiu, Ming Yin, Mengdi Wang, Peter Bartlett, Andrea Zanette

专题命中 偏好对齐 :alignment(abstract);DPO(abstract);分类 cs.CL

Comments NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.09024 2024-10-31 cs.LG 70%

Aligning Diffusion Behaviors with Q-functions for Efficient Continuous Control

Huayu Chen, Kaiwen Zheng, Hang Su, Jun Zhu

专题命中 偏好对齐 :alignment(abstract);DPO(abstract);分类 cs.LG

Comments Accepted by NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏