arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-11-12 至 2025-11-12 共收录 9 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 9 篇

2503.20995 2025-11-12 cs.CL 85%

ENCORE: Entropy-guided Reward Composition for Multi-head Safety Reward Models

Xiaomin Li, Xupeng Chen, Jingxuan Fan, Eric Hanchen Jiang, Mingye Gao

专题命中 偏好对齐 :safety(title,abstract);alignment(abstract);RLHF(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23349 2025-11-12 cs.LG cs.AI 84%

Towards Reward Fairness in RLHF: From a Resource Allocation Perspective

Sheng Ouyang, Yulan Hu, Ge Chen, Qingyang Li, Fuzheng Zhang, Yong Liu

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院) Beijing Key Laboratory of Research on Large Models and Intelligent Governance(北京大型模型与智能治理研究重点实验室) Engineering Research Center of Next-Generation Intelligent Search and Recommendation, MOE(下一代智能搜索与推荐工程技术研究中心,教育部) Kuaishou Technology(快手科技) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 偏好对齐 :RLHF(title,abstract);alignment(abstract);分类 cs.AI、cs.LG

Comments Accepted to ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23777 2025-11-12 cs.CL 79%

CONGRAD:Conflicting Gradient Filtering for Multilingual Preference Alignment

Jiangnan Li, Thuy-Trang Vu, Christian Herold, Amirhossein Tebbifakhr, Shahram Khadivi, Gholamreza Haffari

机构 * Department of Data Science and AI, Monash University, Australia(墨尔本大学数据科学与人工智能系) eBay Inc.(eBay公司)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07477 2025-11-12 cs.CY cs.AI cs.CL 75%

The Polite Liar: Epistemic Pathology in Language Models

Bentley DeVilling

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.CL、cs.AI、cs.CY

Comments 17 pages, 2 tables, Preprint - under review at AI & Society

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07691 2025-11-12 cs.CL cs.AI 73%

CAPO: Confidence Aware Preference Optimization Learning for Multilingual Preferences

Rhitabrat Pokharel, Yufei Tao, Ameeta Agrawal

机构 * Department of Computer Science(计算机科学系)

专题命中 偏好对齐 :alignment(abstract);DPO(abstract);分类 cs.CL、cs.AI

Comments Accepted at IJCNLP-AACL 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08394 2025-11-12 cs.CL cs.AI cs.HC cs.LG 67%

Interaction Dynamics as a Reward Signal for LLMs

Sian Gooding, Edward Grefenstette

机构 * Google DeepMind(谷歌DeepMind)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07896 2025-11-12 cs.AI cs.CL 62%

SparseRM: A Lightweight Preference Modeling with Sparse Autoencoder

Dengcan Liu, Jiahao Li, Zheren Fu, Yi Tu, Jiajun Li, Zhendong Mao, Yongdong Zhang

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI

Comments 15pages,11figures,AAAI-26

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07483 2025-11-12 cs.AI cs.LG 62%

Beyond Correctness: Confidence-Aware Reward Modeling for Enhancing Large Language Model Reasoning

Qianxi He, Qingyu Ren, Shanzhe Lei, Xuhong Wang, Yingchun Wang

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Key Laboratory of Data Science, School of Computer Science, Fudan University(上海数据科学关键实验室,计算机科学学院,复旦大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08555 2025-11-12 cs.FL 50%

RESTL: Reinforcement Learning Guided by Multi-Aspect Rewards for Signal Temporal Logic Transformation

Yue Fang, Jin Zhi, Jie An, Hongshen Chen, Xiaohong Chen, Naijun Zhan

专题命中 偏好对齐 :alignment(abstract)

Comments 12 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏