arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 3278 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 3278 篇

2504.09643 2025-04-15 cs.CL cs.IR cs.SE 57%

Iterative Self-Training for Code Generation via Reinforced Re-Ranking

Nikita Sorokin, Ivan Sedykh, Valentin Malykh

机构 * MTS AI International IT University(国际信息技术大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

Comments Published at ECIR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.00689 2025-04-08 cs.CL 57%

PrefRAG: Preference-Driven Multi-Source Retrieval Augmented Generation

Qingfei Zhao, Ruobing Wang, Yukuo Cen, Daren Zha, Shicheng Tan, Jie Tang

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院) Tsinghua University(清华大学) Zhipu AI(智谱AI)

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL

Comments 33 pages, 5 figures, 28 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.08821 2025-04-08 cs.CL 57%

DeepNote: Note-Centric Deep Retrieval-Augmented Generation

Ruobing Wang, Qingfei Zhao, Yukun Yan, Daren Zha, Yuxuan Chen, Shi Yu, Zhenghao Liu, Yixuan Wang, Shuo Wang, Xu Han, Zhiyuan Liu, Maosong Sun

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院) Institute for AI, Tsinghua University(清华大学人工智能研究院) South China University of Technology(华南理工大学) Northeastern University(东北大学)

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL

Comments 28 pages, 6 figures, 21 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04040 2025-04-08 cs.AI cs.RO 57%

ADAPT: Actively Discovering and Adapting to Preferences for any Task

Maithili Patel, Xavier Puig, Ruta Desai, Roozbeh Mottaghi, Sonia Chernova, Joanne Truong, Akshara Rai

机构 * Georgia Institute of Technology(佐治亚理工学院) FAIR Labs, Meta(Meta FAIR实验室)

专题命中 偏好对齐 :DPO(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02949 2025-04-07 cs.CV cs.AI 57%

VARGPT-v1.1: Improve Visual Autoregressive Large Unified Model via Iterative Instruction Tuning and Reinforcement Learning

Xianwei Zhuang, Yuxin Xie, Yufan Deng, Dongchao Yang, Liming Liang, Jinghan Ru, Yuguo Yin, Yuexian Zou

机构 * School of Electronic and Computer Engineering, Peking University(北京大学电子与计算机工程学院) The Chinese University of Hong Kong(香港中文大学)

专题命中 偏好对齐 :DPO(abstract);分类 cs.AI

Comments Code is available at: https://github.com/VARGPT-family/VARGPT-v1.1. arXiv admin note: text overlap with arXiv:2501.12327

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02463 2025-04-04 cs.IR cs.AI 57%

Evaluating AI Recruitment Sourcing Tools by Human Preference

Vladimir Slaykovskiy, Maksim Zvegintsev, Yury Sakhonchyk, Hrachik Ajamian

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22230 2025-04-03 cs.LG 57%

Exploring Data Scaling Trends and Effects in Reinforcement Learning from Human Feedback

Wei Shen, Guanlin Liu, Zheng Wu, Ruofei Zhu, Qingping Yang, Chao Xin, Yu Yue, Lin Yan

机构 * ByteDance Seed(字节跳动种子项目(或字节跳动Seed))

专题命中 偏好对齐 :RLHF(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18089 2025-03-25 cs.CL 57%

$D^2LoRA$: Data-Driven LoRA Initialization for Low Resource Tasks

Javad SeraJ, Mohammad Mahdi Mohajeri, Mohammad Javad Dousti

机构 * University of Tehran(德黑兰大学)

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17489 2025-03-25 cs.CL cs.CV 57%

Judge Anything: MLLM as a Judge Across Any Modality

Shu Pu, Yaochen Wang, Dongping Chen, Yuhang Chen, Guohao Wang, Qi Qin, Zhongyi Zhang, Zhiyuan Zhang, Zetong Zhou, Shuang Gong, Yi Gui, Yao Wan, Philip S. Yu

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18008 2025-03-24 cs.SD cs.AI eess.AS 57%

NotaGen: Advancing Musicality in Symbolic Music Generation with Large Language Model Training Paradigms

Yashan Wang, Shangda Wu, Jianhuai Hu, Xingjian Du, Yueqi Peng, Yongxin Huang, Shuai Fan, Xiaobing Li, Feng Yu, Maosong Sun

机构 * Central Conservatory of Music(中央音乐学院) University of Rochester(罗切斯特大学) Beijing Flowingtech Ltd.(北京流音科技有限公司) Beihang University(北京航空航天大学) Tsinghua University(清华大学)

专题命中 偏好对齐 :DPO(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12167 2025-03-20 cs.CL 57%

PLM: Efficient Peripheral Language Models Hardware-Co-Designed for Ubiquitous Computing

Cheng Deng, Luoyang Sun, Jiwen Jiang, Yongcheng Zeng, Xinjian Wu, Wenxin Zhao, Qingfa Xiao, Jiachuan Wang, Haoyang Li, Lei Chen, Lionel M. Ni, Haifeng Zhang, Jun Wang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Institution of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University College London(伦敦大学学院) The Hong Kong University of Science and Technology(香港科技大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01224 2025-03-18 cs.LG 57%

CE-U: Cross Entropy Unlearning

Bo Yang

机构 * Tacnode US Inc(美国塔克诺德公司)

专题命中 偏好对齐 :DPO(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.16236 2025-03-17 stat.ML cs.LG 57%

A transfer learning framework for weak-to-strong generalization

Seamus Somerstep, Felipe Maia Polo, Moulinath Banerjee, Ya'acov Ritov, Mikhail Yurochkin, Yuekai Sun

机构 * University of Michigan(密歇根大学) IBM Research(IBM研究院) MIT-IBM Watson AI Lab(麻省理工学院-IBM沃森人工智能实验室)

专题命中 偏好对齐 :alignment(abstract);分类 cs.LG

Comments v2: Major changes to set up, theory, and experiments v3: Camera ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09223 2025-03-13 cs.IR cs.AI 57%

LREF: A Novel LLM-based Relevance Framework for E-commerce

Tian Tang, Zhixing Tian, Zhenyu Zhu, Chenyang Wang, Haiqing Hu, Guoyu Tang, Lin Liu, Sulong Xu

专题命中 偏好对齐 :DPO(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09029 2025-03-13 cs.CL 57%

DAST: Difficulty-Aware Self-Training on Large Language Models

Boyang Xue, Qi Zhu, Hongru Wang, Rui Wang, Sheng Wang, Hongling Xu, Fei Mi, Yasheng Wang, Lifeng Shang, Qun Liu, Kam-Fai Wong

机构 * The Chinese University of Hong Kong(香港中文大学) The University of Hong Kong(香港大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06358 2025-03-11 cs.LG 57%

Language Model Personalization via Reward Factorization

Idan Shenfeld, Felix Faltings, Pulkit Agrawal, Aldo Pacchiano

机构 * MIT(麻省理工学院) Boston University(波士顿大学)

专题命中 偏好对齐 :RLHF(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04783 2025-03-10 cs.CL cs.CR 57%

Comparative Analysis Based on DeepSeek, ChatGPT, and Google Gemini: Features, Techniques, Performance, Future Prospects

Anichur Rahman, Shahariar Hossain Mahir, Md Tanjum An Tashrif, Airin Afroj Aishi, Md Ahsan Karim, Dipanjali Kundu, Tanoy Debnath, Md. Abul Ala Moududi, MD. Zunead Abedin Eidmum

机构 * National Institute of Textile Engineering and Research (NITER)(国家纺织工程与研究学院(NITER)) Dhaka University(达卡大学) Daffodil International University(水仙花国际大学) Stony Brook University(石溪大学) Bangabandhu Sheikh Mujibur Rahman Digital University(邦班杜·谢赫·穆吉布·拉赫曼数字大学)

专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04222 2025-03-07 cs.CL 57%

FuseChat-3.0: Preference Optimization Meets Heterogeneous Model Fusion

Ziyi Yang, Fanqi Wan, Longguang Zhong, Canbin Huang, Guosheng Liang, Xiaojun Quan

机构 * School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院)

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL

Comments Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.18640 2025-03-07 cs.CL 57%

Weak-to-Strong Preference Optimization: Stealing Reward from Weak Aligned Model

Wenhong Zhu, Zhiwei He, Xiaofeng Wang, Pengfei Liu, Rui Wang

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

Comments ICLR 2025(Spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.11226 2025-03-06 cs.LG 57%

The Power of Active Multi-Task Learning in Reinforcement Learning from Human Feedback

Ruitao Chen, Liwei Wang

机构 * Peking University(北京大学)

专题命中 偏好对齐 :RLHF(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.02712 2025-03-05 cs.CV cs.CL 57%

LLaVA-Critic: Learning to Evaluate Multimodal Models

Tianyi Xiong, Xiyao Wang, Dong Guo, Qinghao Ye, Haoqi Fan, Quanquan Gu, Heng Huang, Chunyuan Li

机构 * ByteDance(字节跳动) University of Maryland, College Park(马里兰大学学院公园分校)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

Comments Accepted by CVPR 2025; Project Page: https://llava-vl.github.io/blog/2024-10-03-llava-critic

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.10944 2025-03-04 cs.CL 57%

Naturally Occurring Feedback is Common, Extractable and Useful

Shachar Don-Yehiya, Leshem Choshen, Omri Abend

机构 * The Hebrew University of Jerusalem(耶路撒冷希伯来大学) MIT(麻省理工学院) MIT-IBM Watson AI Lab(麻省理工-IBM沃森人工智能实验室)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.03856 2025-03-04 cs.LG 57%

Q-Adapter: Customizing Pre-trained LLMs to New Preferences with Forgetting Mitigation

Yi-Chen Li, Fuxiang Zhang, Wenjie Qiu, Lei Yuan, Chengxing Jia, Zongzhang Zhang, Yang Yu, Bo An

机构 * Nanjing University(南京大学) Polixir Technologies(Polixir科技公司) Nanyang Technological University(南洋理工大学) Skywork AI(天工AI)

专题命中 偏好对齐 :RLHF(abstract);分类 cs.LG

Comments Camera ready version of ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.08694 2025-03-04 cs.CL 57%

TeaMs-RL: Teaching LLMs to Generate Better Instruction Datasets via Reinforcement Learning

Shangding Gu, Alois Knoll, Ming Jin

机构 * UC Berkeley(加州大学伯克利分校) Technical University of Munich(慕尼黑工业大学) Virginia Tech(弗吉尼亚理工大学)

专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.17146 2025-03-03 cs.LG cs.CV 57%

LiNeS: Post-training Layer Scaling Prevents Forgetting and Enhances Model Merging

Ke Wang, Nikolaos Dimitriadis, Alessandro Favero, Guillermo Ortiz-Jimenez, Francois Fleuret, Pascal Frossard

机构 * EPFL(洛桑联邦理工学院) Google DeepMind(谷歌DeepMind) University of Geneva(日内瓦大学) Meta FAIR

专题命中 偏好对齐 :RLHF(abstract);分类 cs.LG

Comments The first two authors contributed equally to this work. Accepted at ICLR 2025. Project website: https://lines-merging.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.02392 2025-03-03 cs.LG stat.ML 57%

Building Math Agents with Multi-Turn Iterative Preference Learning

Wei Xiong, Chengshuai Shi, Jiaming Shen, Aviv Rosenberg, Zhen Qin, Daniele Calandriello, Misha Khalman, Rishabh Joshi, Bilal Piot, Mohammad Saleh, Chi Jin, Tong Zhang, Tianqi Liu

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Virginia(弗吉尼亚大学) Google DeepMind(谷歌DeepMind) Google Research(谷歌研究院) Princeton University(普林斯顿大学)

专题命中 偏好对齐 :DPO(abstract);分类 cs.LG

Comments A multi-turn direct preference learning framework for tool-integrated reasoning tasks

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.13156 2025-02-28 cs.CL 57%

RRM: Robust Reward Model Training Mitigates Reward Hacking

Tianqi Liu, Wei Xiong, Jie Ren, Lichang Chen, Junru Wu, Rishabh Joshi, Yang Gao, Jiaming Shen, Zhen Qin, Tianhe Yu, Daniel Sohn, Anastasiia Makarova, Jeremiah Liu, Yuan Liu, Bilal Piot, Abe Ittycheriah, Aviral Kumar, Mohammad Saleh

机构 * Google DeepMind(谷歌DeepMind) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Maryland, College Park(马里兰大学学院公园分校)

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL

Comments Accepted in ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.03187 2025-02-27 cs.CL 57%

Weighted-Reward Preference Optimization for Implicit Model Fusion

Ziyi Yang, Fanqi Wan, Longguang Zhong, Tianyuan Shi, Xiaojun Quan

机构 * School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

Comments Accepted to ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.09008 2025-02-27 cs.CL 57%

SuperCorrect: Advancing Small LLM Reasoning with Thought Template Distillation and Self-Correction

Ling Yang, Zhaochen Yu, Tianjun Zhang, Minkai Xu, Joseph E. Gonzalez, Bin Cui, Shuicheng Yan

机构 * Peking University(北京大学) Skywork AI(天工AI) National University of Singapore(新加坡国立大学) UC Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL

Comments ICLR 2025. Project: https://github.com/YangLing0818/SuperCorrect-llm

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14044 2025-02-26 cs.CV cs.LG 57%

Enhancing Cognition and Explainability of Multimodal Foundation Models with Self-Synthesized Data

Yucheng Shi, Quanzheng Li, Jin Sun, Xiang Li, Ninghao Liu

机构 * School of Computing, University of Georgia(佐治亚大学计算学院) Massachusetts General Hospital(麻省总医院) Harvard Medical School(哈佛医学院)

专题命中 偏好对齐 :alignment(abstract);分类 cs.LG

Comments Accepted by ICLR 2025. Code: https://github.com/sycny/SelfSynthX

详情

展开后加载摘要…

URL PDF HTML 收藏