arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-09-23 至 2025-09-23 共收录 9 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 9 篇

2410.16531 2025-09-23 cs.CL cs.AI cs.FL cs.LG 80%

Bayesian scaling laws for in-context learning

Aryaman Arora, Dan Jurafsky, Christopher Potts, Noah D. Goodman

机构 * Stanford University(斯坦福大学)

专题命中 偏好对齐 :alignment(abstract);DPO(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG

Comments COLM 2025 camera-ready version; 9 pages main text, 39 pages total

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13146 2025-09-23 cs.CV cs.LG 77%

Re-Align: Aligning Vision Language Models via Retrieval-Augmented Direct Preference Optimization

Shuo Xing, Peiran Li, Yuping Wang, Ruizheng Bai, Yueqi Wang, Chan-Wei Hu, Chengxuan Qian, Huaxiu Yao, Zhengzhong Tu

机构 * Texas A&M University(德克萨斯大学) University of Michigan(密歇根大学) UIUC(伊利诺伊大学香槟分校) UNC Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);DPO(abstract);分类 cs.LG

Comments Published at EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13388 2025-09-23 cs.CL cs.AI cs.LG 67%

R3: Robust Rubric-Agnostic Reward Models

David Anugraha, Zilu Tang, Lester James V. Miranda, Hanyang Zhao, Mohammad Rifqi Farhansyah, Garry Kuwanto, Derry Wijaya, Genta Indra Winata

机构 * Stanford University(斯坦福大学) Boston University(波士顿大学) Columbia University(哥伦比亚大学) University of Toronto(多伦多大学) Institut Teknologi Bandung(Bandung 工程技术大学) Monash University Indonesia(墨尔本大学印尼分校) Capital One

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04039 2025-09-23 cs.CV cs.AI cs.CL 62%

Mitigating Hallucinations in Large Vision-Language Models via Entity-Centric Multimodal Preference Optimization

Jiulong Wu, Zhengliang Shi, Shuaiqiang Wang, Jizhou Huang, Dawei Yin, Lingyong Yan, Min Cao, Min Zhang

机构 * Soochow University(苏州大学) Baidu Inc.(百度公司) Shandong University(山东大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI

Comments This paper is accepted by EMNLP2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16475 2025-09-23 cs.LG cs.CL 62%

Towards Universal Debiasing for Language Models-based Tabular Data Generation

Tianchun Li, Tianci Liu, Xingchen Wang, Rongzhe Wei, Pan Li, Lu Su, Jing Gao

机构 * Purdue University(普渡大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL、cs.LG

Comments EMNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16965 2025-09-23 cs.CL 57%

Preference Distillation via Value based Reinforcement Learning

Minchan Kwon, Junwon Ko, Kangil Kim, Junmo Kim

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国先进科学技术研究院) Gwangju Institute of Science and Technology (GIST)(全州科学技术院)

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL

Comments 20 page

Journal ref NIPS 2025 Poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16679 2025-09-23 cs.CL 57%

Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle

Keliang Liu, Dingkang Yang, Ziyun Qian, Weijie Yin, Yuchi Wang, Hongsheng Li, Jun Liu, Peng Zhai, Yang Liu, Lihua Zhang

机构 * Fudan University(复旦大学) The Chinese University of Hong Kong, MMLab(香港中文大学MMLab) Lancaster University(兰卡斯特大学) Tongji University(同济大学) The University of Toronto(多伦多大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

Comments A Survey of Reinforcement Learning for Large Language Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16895 2025-09-23 cs.IR 50%

Temporal-Aware User Behaviour Simulation with Large Language Models for Recommender Systems

Xinye Wanyan, Danula Hettiachchi, Chenglong Ma, Ziqi Xu, Jeffrey Chan

专题命中 偏好对齐 :alignment(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16560 2025-09-23 cs.CV 50%

Captioning for Text-Video Retrieval via Dual-Group Direct Preference Optimization

Ji Soo Lee, Byungoh Ko, Jaewon Cho, Howoong Lee, Jaewoon Byun, Hyunwoo J. Kim

机构 * Korea University(韩国大学) Hanwha Vision(翰威英航) KAIST(韩国科学技术院)

专题命中 偏好对齐 :DPO(abstract)

Comments EMNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏