arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-10-31 至 2025-10-31 共收录 4 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 4 篇

2503.03710 2025-10-31 cs.CL cs.CR cs.LG 91%

Improving LLM Safety Alignment with Dual-Objective Optimization

Xuandong Zhao, Will Cai, Tianneng Shi, David Huang, Licong Lin, Song Mei, Dawn Song

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 偏好对齐 :alignment(title,abstract);safety(title,abstract);DPO(abstract);jailbreak(abstract)

Comments ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25884 2025-10-31 cs.AI cs.CL cs.LG 67%

Approximating Human Preferences Using a Multi-Judge Learned System

Eitán Sprejer, Fernando Avalos, Augusto Bernardi, Jose Pedro Brito de Azevedo Faustino, Jacob Haimes, Narmeen Fatimah Oozeer

机构 * BAISH | UBA | Apart Research(BAISH | UBA | Apart研究) University of São Paulo(圣保罗大学) Apart Research(Apart研究) Dovetail Research | Apart Research(Dovetail研究 | Apart研究)

专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02820 2025-10-31 cs.AI cs.CL cs.LG 67%

AutoLibra: Agent Metric Induction from Open-Ended Human Feedback

Hao Zhu, Phil Cuvin, Xinkai Yu, Charlotte Ka Yee Yan, Jason Zhang, Diyi Yang

机构 * Stanford University(斯坦福大学) University of Toronto(多伦多大学) University of Pennsylvania(宾夕法尼亚大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

Comments https://github.com/Open-Social-World/autolibra

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07127 2025-10-31 cs.RO cs.AI 57%

Human-assisted Robotic Policy Refinement via Action Preference Optimization

Wenke Xia, Yichu Yang, Hongtao Wu, Xiao Ma, Tao Kong, Di Hu

机构 * Gaoling School of Artificial Intelligence, Renmin University of China, Beijing(中国人民大学北京校区人工智能学院) Engineering Research Center of Next-Generation Intelligent Search(下一代智能搜索与推荐工程研究中心) Beijing Key Laboratory of Research on Large Models(北京大型模型研究重点实验室)

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI

Comments Accepted By NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏