arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-08-14 至 2025-08-14 共收录 3 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 3 篇

2502.18862 2025-08-14 cs.LG cs.AI 84%

One-shot Optimized Steering Vectors Mediate Safety-relevant Behaviors in LLMs

Jacob Dunefsky, Arman Cohan

机构 * Department of Computer Science(计算机科学系) Yale University(耶鲁大学)

专题命中 安全训练 :safety(title,abstract);alignment(abstract);分类 cs.AI、cs.LG

Comments Published at COLM 2025. 30 pages, 7 figures. Code is available at https://github.com/jacobdunefsky/one-shot-steering-repro and https://github.com/jacobdunefsky/one-shot-steering-misalignment

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09224 2025-08-14 cs.CY cs.AI cs.CL 82%

From Hard Refusals to Safe-Completions: Toward Output-Centric Safety Training

Yuan Yuan, Tina Sriskandarajah, Anna-Luisa Brakman, Alec Helyar, Alex Beutel, Andrea Vallone, Saachi Jain

专题命中 安全训练 :safety(title,abstract);分类 cs.CL、cs.AI、cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.16608 2025-08-14 cs.RO cs.SY eess.SY 50%

Barriers on the EDGE: A scalable CBF architecture over EDGE for safe aerial-ground multi-agent coordination

Viswa Narayanan Sankaranarayanan, Achilleas Santi Seisa, Akshit Saradagi, Sumeet Satpute, George Nikolakopoulos

机构 * Robotics and Artificial Intelligence Group of the Department of Computer Science, Electrical and Space Engineering at Luleå University of Technology(鲁内斯大学机器人与人工智能小组)

专题命中 安全训练 :safety(abstract)

Comments 6 pages, 2 figures, first draft of a paper currently under review

详情

展开后加载摘要…

URL PDF HTML 收藏