arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-08-19 至 2025-08-19 共收录 5 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 5 篇

2508.12531 2025-08-19 cs.LG cs.AI 81%

Rethinking Safety in LLM Fine-tuning: An Optimization Perspective

Minseon Kim, Jin Myung Kwak, Lama Alssum, Bernard Ghanem, Philip Torr, David Krueger, Fazl Barez, Adel Bibi

机构 * Microsoft Research(微软研究院) KAIST(韩国科学技术院) KAUST(韩国科学技术大学) Université de Montréal(蒙特利尔大学) Mila(蒙特利尔人工智能研究院) WhiteBox(WhiteBox公司) University of Oxford(牛津大学)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14850 2025-08-19 cs.LG cs.AI cs.RO 81%

Hierarchical Multi-Agent Reinforcement Learning with Control Barrier Functions for Safety-Critical Autonomous Systems

H. M. Sabbir Ahmad, Ehsan Sabouni, Alexander Wasilkoff, Param Budhraja, Zijian Guo, Songyuan Zhang, Chuchu Fan, Christos Cassandras, Wenchao Li

机构 * Boston University(波士顿大学) Massachusetts Institute of Technology(麻省理工学院)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12920 2025-08-19 cs.AI cs.MA 70%

Do Large Language Model Agents Exhibit a Survival Instinct? An Empirical Study in a Sugarscape-Style Simulation

Atsushi Masumori, Takashi Ikegami

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.02903 2025-08-19 cs.CE cs.LG cs.NA math.NA 57%

Predicting Open-Hole Laminates Failure Using Support Vector Machines With Classical and Quantum Kernels

Giorgio Tosti Balducci, Boyang Chen, Matthias Möller, Marc Gerritsma, Roeland De Breuker

机构 * Delft University of Technology(代尔夫特理工大学)

专题命中 安全训练 :alignment(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11799 2025-08-19 math.OC cs.RO 50%

Scaling Robust Optimization for Swarms: A Distributed Perspective

Arshiya Taj Abdul, Augustinos D. Saravanos, Evangelos A. Theodorou

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 安全训练 :safety(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏