arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-11-26 至 2025-11-26 共收录 3 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 3 篇

2511.19504 2025-11-26 cs.LG stat.ML 90%

Position: The Complexity of Perfect AI Alignment -- Formalizing the RLHF Trilemma

位置:完美AI对齐的复杂性——形式化RLHF三重困境

Subramanyam Sahoo, Aman Chadha, Vinija Jain, Divya Chaudhary

机构 * Berkeley AI Safety Initiative (BASIS), University of California, Berkeley(伯克利人工智能安全倡议(BASIS),加州大学伯克利分校) AWS Generative AI Innovation Center, Amazon Web Services(亚马逊网络服务生成式人工智能创新中心) Meta AI Stanford University(斯坦福大学) Northeastern University, Seattle, WA, USA(东北大学,西雅图,华盛顿州,美国)

专题命中 偏好对齐 :alignment(title,abstract);RLHF(title,abstract);safety(abstract);分类 cs.LG

AI总结 研究提出RLHF三重困境,指出在安全、公平和稳健之间存在根本性权衡,并通过复杂性分析证明实现全球代表性需要超多项式计算资源。

Comments Accepted at NeurIPS 2025 Workshop on Socially Responsible and Trustworthy Foundation Models (ResponsibleFM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08746 2025-11-26 cs.LG 70%

Interpretable Reward Model via Sparse Autoencoder

通过稀疏自编码器的可解释奖励模型

Shuyi Zhang, Wei Shi, Sihang Li, Jiayi Liao, Hengxing Cai, Xiang Wang

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.LG

AI总结 SARM通过整合预训练稀疏自编码器,提升奖励模型的可解释性和对齐性能。

Comments AAAI 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19523 2025-11-26 cs.CR 67%

EAGER: Edge-Aligned LLM Defense for Robust, Efficient, and Accurate Cybersecurity Question Answering

EAGER: 边缘对齐的LLM防御方法用于鲁棒、高效且准确的网络安全问答

Onat Gungor, Roshan Sood, Jiasheng Zhou, Tajana Rosing

专题命中 偏好对齐 :alignment(abstract);DPO(abstract)

AI总结 EAGER通过参数高效量化与领域偏好对齐,提升网络安全问答的鲁棒性、效率和准确性,降低对抗攻击成功率并优化响应延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏