arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-10-23 至 2025-10-23 共收录 4 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 4 篇

2405.11647 2025-10-23 cs.AI cs.LG 73%

Hummer: Towards Limited Competitive Preference Dataset

Li Jiang, Yusen Wu, Junwu Xiong, Jingqing Ruan, Yichuan Ding, Qingpei Guo, Zujie Wen, Jun Zhou, Xiaotie Deng

机构 * Mila, McGill University(蒙特利尔大学Mila实验室) Peking University(北京大学) Ant Group(蚂蚁集团)

专题命中 偏好对齐 :alignment(abstract);jailbreak(abstract);分类 cs.AI、cs.LG

Journal ref COLM 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19050 2025-10-23 cs.AI cs.LG 62%

Rectifying Shortcut Behaviors in Preference-based Reward Learning

Wenqian Ye, Guangtao Zheng, Aidong Zhang

机构 * University of Virginia(弗吉尼亚大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI、cs.LG

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15061 2025-10-23 cs.LG cs.CL 62%

Antislop: A Comprehensive Framework for Identifying and Eliminating Repetitive Patterns in Language Models

Samuel Paech, Allen Roush, Judah Goldfeder, Ravid Shwartz-Ziv

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL、cs.LG

Comments 11 pages + appendices, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18895 2025-10-23 cs.SE cs.AI cs.HC 57%

CosmoCore Affective Dream-Replay Reinforcement Learning for Code Generation

Santhosh Kumar Ravindran

机构 * Microsoft Corporation(微软公司)

专题命中 偏好对齐 :RLHF(abstract);分类 cs.AI

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏