arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-02-18 至 2026-02-18 共收录 3 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 3 篇

2602.15799 2026-02-18 cs.LG cs.AI 88%

The Geometry of Alignment Collapse: When Fine-Tuning Breaks Safety

对齐崩溃的几何学:当微调破坏安全性

Max Springer, Chung Peng Lee, Blossom Metevier, Jane Castleman, Bohdan Turbal, Hayoung Jung, Zeyu Shen, Aleksandra Korolova

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.AI、cs.LG

AI总结 研究揭示了微调过程中对齐脆弱性是梯度下降在曲面上的固有几何属性,提出四次方定律描述对齐损失随训练时间的增长,并呼吁发展曲率感知方法以提升安全性。

Comments 27 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15061 2026-02-18 cs.RO cs.AI 79%

Safe-SDL:Establishing Safety Boundaries and Control Mechanisms for AI-Driven Self-Driving Laboratories

Safe-SDL:建立AI驱动自主实验室的安全边界与控制机制

Zihan Zhang, Haohui Que, Junhan Chang, Xin Zhang, Hao Wei, Tong Zhu

机构 * Shanghai Innovation Institute(上海创新研究院) Nankai University(南开大学) East China Normal University(华东师范大学) AI for Science Institute, Beijing(北京人工智能科学研究院) Peking University(北京大学) DP Technology(DP技术公司) Shanghai Jiao Tong University(上海交通大学) National Key Laboratory of Advanced Micro and Nano Manufacture Technology, School of Integrated Circuits, Shanghai Jiao Tong University, Shanghai 200240, China(上海交通大学国家先进微纳米制造技术重点实验室,集成电路学院,上海200240,中国)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

AI总结 Safe-SDL通过建立安全边界和控制机制,解决AI驱动自主实验室中的语法到安全间隙问题,确保实验系统的安全性和一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12444 2026-02-18 cs.LG cs.AI 62%

Safe Reinforcement Learning via Recovery-based Shielding with Gaussian Process Dynamics Models

通过基于恢复的防护机制实现安全强化学习

Alexander W. Goodall, Francesco Belardinelli

机构 * Imperial College London, Department of Computing(伦敦帝国学院计算机系)

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种基于高斯过程的恢复防护机制,用于在未知非线性系统中实现安全强化学习,通过动态恢复和内部模型采样实现安全与高效的学习。

Comments Accepted at AAMAS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏