arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-07-29 至 2025-07-29 共收录 11 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 11 篇

2504.02193 2025-07-29 cs.AI 92%

More is Less: The Pitfalls of Multi-Model Synthetic Preference Data in DPO Safety Alignment

Yifan Wang, Runjin Chen, Bolian Li, David Cho, Yihe Deng, Ruqi Zhang, Tianlong Chen, Zhangyang Wang, Ananth Grama, Junyuan Hong

机构 * Purdue University(普渡大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校) The University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 偏好对齐 :alignment(title,abstract);DPO(title,abstract);safety(title,abstract);RLHF(abstract)

Comments This version includes updated results and expanded discussion

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19672 2025-07-29 cs.AI cs.LG stat.ML 88%

Alignment and Safety in Large Language Models: Safety Mechanisms, Training Paradigms, and Emerging Challenges

Haoran Lu, Luyang Fang, Ruidong Zhang, Xinliang Li, Jiazhang Cai, Huimin Cheng, Lin Tang, Ziyu Liu, Zeliang Sun, Tao Wang, Yingchuan Zhang, Arif Hassan Zidan, Jinwen Xu, Jincheng Yu, Meizhi Yu, Hanqi Jiang, Xilin Gong, Weidi Luo, Bolun Sun, Yongkai Chen, Terry Ma, Shushan Wu, Yifan Zhou, Junhao Chen, Haotian Xiang, Jing Zhang, Afrar Jahin, Wei Ruan, Ke Deng, Yi Pan, Peilong Wang, Jiahui Li, Zhengliang Liu, Lu Zhang, Lin Zhao, Wei Liu, Dajiang Zhu, Xin Xing, Fei Dou, Wei Zhang, Chao Huang, Rongjie Liu, Mengrui Zhang, Yiwen Liu, Xiaoxiao Sun, Qin Lu, Zhen Xiang, Wenxuan Zhong, Tianming Liu, Ping Ma

机构 * Department of Statistics, University of Georgia(统计学系,佐治亚大学) School of Computing, University of Georgia(计算学院,佐治亚大学) Department of Biostatistics, Boston University(生物统计学系,波士顿大学) Department of Epidemiology & Biostatistics, University of Georgia(流行病学与生物统计学系,佐治亚大学) School of Computer and Cyber Sciences, Augusta University(计算机与网络科学学院,奥古斯塔大学) School of Electrical and Computer Engineering, University of Georgia(电气与计算机工程学院,佐治亚大学) Department of Statistics & Data Science, University of Arizona(统计学与数据科学系,亚利桑那大学) Kellogg School of Management, Northwestern University(凯洛格管理学院,西北大学) Department of Statistics, Harvard University(统计学系,哈佛大学) School of Computer Science, Carnegie Mellon University(计算机科学学院,卡内基梅隆大学)

专题命中 偏好对齐 :alignment(title,abstract);safety(title);DPO(abstract);分类 cs.AI、cs.LG

Comments 119 pages, 10 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20335 2025-07-29 cs.LG cs.AI 81%

Cultivating Helpful, Personalized, and Creative AI Tutors: A Framework for Pedagogical Alignment using Reinforcement Learning

Siyu Song, Wentao Liu, Ye Lu, Ruohua Zhang, Tao Liu, Jinze Lv, Xinyun Wang, Aimin Zhou, Fei Tan, Bo Jiang, Hao Hao

机构 * Shanghai Innavation Institute(上海创新研究院) Shanghai Institute of AI for Education(上海人工智能教育研究院) School of Computer Science and Technology(计算机科学与技术学院) Department of Educational Information Technology(教育信息技术系)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12854 2025-07-29 cs.CL 79%

Enhancing LLM Reasoning with Iterative DPO: A Comprehensive Empirical Investigation

Songjun Tu, Jiahao Lin, Xiangyu Tian, Qichao Zhang, Linjing Li, Yuqian Fu, Nan Xu, Wei He, Xiangyuan Lan, Dongmei Jiang, Dongbin Zhao

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Pengcheng Laboratory(鹏城实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Wenge Technology(文生科技) Fudan University(复旦大学)

专题命中 偏好对齐 :DPO(title,abstract);分类 cs.CL

Comments 23pages

Journal ref COLM2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20181 2025-07-29 cs.CL cs.AI 73%

SGPO: Self-Generated Preference Optimization based on Self-Improver

Hyeonji Lee, Daejin Jo, Seohwan Yun, Sungwoong Kim

机构 * Korea University(韩国大学)

专题命中 偏好对齐 :alignment(abstract);DPO(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21560 2025-07-29 cs.CL cs.AI 73%

Reinforcement learning fine-tuning of language model for instruction following and math reasoning

Yifu Han, Geo Zhang

机构 * Stanford University(斯坦福大学)

专题命中 偏好对齐 :alignment(abstract);DPO(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.00222 2025-07-29 cs.CL cs.AI cs.LG 67%

Learning to Clarify: Multi-turn Conversations with Action-Based Contrastive Self-Training

Maximillian Chen, Ruoxi Sun, Tomas Pfister, Sercan Ö. Arık

机构 * Google(谷歌) Columbia University(哥伦比亚大学)

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL、cs.AI、cs.LG

Comments ICLR 2025; Code: https://github.com/google-research/google-research/tree/master/learning_to_clarify

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20956 2025-07-29 cs.CL cs.AI 62%

Mind the Gap: Conformative Decoding to Improve Output Diversity of Instruction-Tuned Large Language Models

Max Peeperkorn, Tom Kouwenhoven, Dan Brown, Anna Jordanous

机构 * School of Computing University of Kent(肯特大学计算机学院) Leiden Institute of Advanced Computer Science Universiteit Leiden(莱顿先进计算机科学研究所) Cheriton School of Computer Science University of Waterloo(滑铁卢大学查里顿计算机科学学院)

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL、cs.AI

Comments 9 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.06645 2025-07-29 cs.CL cs.AI 62%

FocalPO: Enhancing Preference Optimizing by Focusing on Correct Preference Rankings

Tong Liu, Xiao Yu, Wenxuan Zhou, Jindong Gu, Volker Tresp

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL、cs.AI

Comments ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20000 2025-07-29 cs.AI cs.DL 57%

Matching Game Preferences Through Dialogical Large Language Models: A Perspective

Renaud Fabre, Daniel Egret, Patrice Bellot

专题命中 偏好对齐 :trustworthy(abstract);分类 cs.AI

Comments 28 pages, 1 figure. Published in Applied Sciences

Journal ref Applied Sciences, 2025, 15(15), 8307

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19679 2025-07-29 cs.CV cs.AI 57%

Efficient Learning for Product Attributes with Compact Multimodal Models

Mandar Kulkarni

机构 * Flipkart Data Science(Flipkart数据科学)

专题命中 偏好对齐 :DPO(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏