arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-12-19 至 2025-12-19 共收录 2 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 2 篇

2512.15782 2025-12-19 cs.CR cs.CL cs.LG 84%

Auto-Tuning Safety Guardrails for Black-Box Large Language Models

为黑盒大语言模型自动调整安全防护栏

Perry Abdulkadir

机构 * University of St. Thomas(圣托马斯大学)

专题命中 越狱攻击 :safety(title,abstract);jailbreak(abstract);分类 cs.CL、cs.LG

AI总结 本文提出通过超参数优化来自动调整黑盒大语言模型的安全防护栏,以提高其安全性和效率。

Comments 8 pages, 7 figures, 1 table. Work completed as part of the M.S. in Artificial Intelligence at the University of St. Thomas using publicly available models and datasets; all views and any errors are the author's own

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15790 2025-12-19 cs.CR 50%

Bilevel Optimization for Covert Memory Tampering in Heterogeneous Multi-Agent Architectures (XAMT)

针对异构多智能体架构中的隐蔽内存篡改的双层优化

Akhil Sharma, Shaikh Yaser Arafat, Jai Kumar Sharma, Ken Huang

专题命中 越狱攻击 :safety(abstract)

AI总结 XAMT通过双层优化方法针对异构多智能体架构中的隐蔽内存篡改问题,提出了一种新的训练时威胁模型,以提升系统安全性。

Comments 10 pages, 5 figures, 4 tables. Conference-style paper (IEEEtran). Proposes unified bilevel optimization framework for covert memory poisoning attacks in heterogeneous multi-agent systems (MARL + RAG)

详情

展开后加载摘要…

URL PDF HTML 收藏