arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-12-17 至 2025-12-17 共收录 3 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 3 篇

2512.12066 2025-12-17 cs.LG cs.AI cs.CL 85%

The Instability of Safety: How Random Seeds and Temperature Expose Inconsistent LLM Refusal Behavior

安全性的不稳定性:随机种子和温度如何暴露LLM拒绝行为的一致性问题

Erik Larsen

专题命中 安全训练 :safety(title,abstract);alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究发现LLM在随机种子和温度变化下安全拒绝行为不稳定,提出安全性稳定性指数并推荐多样本评估以提高可靠性。

Comments 16 pages, 7 figures, 9 tables. Code and data available at https://github.com/erikl2/safety-refusal-stability

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13762 2025-12-17 cs.AI cs.HC 79%

State-Dependent Refusal and Learned Incapacity in RLHF-Aligned Language Models

基于状态依赖拒绝和学习无能的强化学习人类反馈对齐语言模型

TK Lee

专题命中 安全训练 :RLHF(title);alignment(abstract);分类 cs.AI

AI总结 本研究提出通过观察行为来审计强化学习人类反馈对齐语言模型中的状态依赖拒绝和学习无能现象。

Comments 23 pages, 6 figures. Qualitative interaction-level analysis of response patterns in a large language model. Code and processed interaction data are available at https://github.com/theMaker-EnvData/llm_learned_incapacity_corpus

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14112 2025-12-17 cs.AI 57%

STEMS: Spatial-Temporal Enhanced Safe Multi-Agent Coordination for Building Energy Management

STEMS: 基于空间-时间增强的安全多智能体协调的建筑能源管理

Huiliang Zhang, Di Wu, Arnaud Zinflou, Benoit Boulet

机构 * Department of Electrical Computer Engineering, McGill University(电气计算机工程系,麦吉尔大学) Data Science Team, Institut de Recherche Hydro Québec(水电研究所数据科学团队)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 STEMS提出一种安全约束的多智能体强化学习框架,通过空间-时间图表示学习和控制屏障函数,提升建筑能源管理的效率与安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏