arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-11-03 至 2025-11-03 共收录 5 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 5 篇

2410.05102 2025-11-03 cs.CL cs.AI cs.LG 85%

SparsePO: Controlling Preference Alignment of LLMs via Sparse Token Masks

Fenia Christopoulou, Ronald Cardenas, Gerasimos Lampouras, Haitham Bou-Ammar, Jun Wang

机构 * Huawei Noah’s Ark Lab(华为诺亚实验室) University College London(伦敦大学学院)

专题命中 偏好对齐 :alignment(title,abstract);harmlessness(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 27 pages, 9 figures, 5 tables. Accepted to EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.23953 2025-11-03 cs.LG cs.AI cs.CL cs.CY cs.GT 84%

Representative Social Choice: From Learning Theory to AI Alignment

Tianyi Qiu

机构 * Peking University(北京大学) UC Berkeley(加州大学伯克利分校) Center for Human-Compatible AI(人类兼容人工智能中心)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL、cs.AI、cs.CY

Comments Journal of Artificial Intelligence Research, in press. Best Paper at NeurIPS 2024 Pluralistic Alignment Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27254 2025-11-03 cs.CL cs.AI cs.LG 82%

Languages are Modalities: Cross-Lingual Alignment via Encoder Injection

Rajan Agarwal, Aarush Gupta

机构 * University of Waterloo(多伦多大学)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments 14 pages, 3 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13487 2025-11-03 cs.CL cs.AI 62%

Detecting Prefix Bias in LLM-based Reward Models

Ashwin Kumar, Yuzi He, Aram H. Markosyan, Bobbie Chern, Imanol Arrieta-Ibarra

机构 * Washington University in St Louis(华盛顿大学圣路易斯分校) Meta Platforms, Inc.(Meta平台公司)

专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26913 2025-11-03 cs.DC 50%

FlowMesh: A Service Fabric for Composable LLM Workflows

Junyi Shen, Noppanat Wadlom, Lingfeng Zhou, Dequan Wang, Xu Miao, Lei Fang, Yao Lu

专题命中 偏好对齐 :RLHF(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏