arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-02-20 至 2026-02-20 共收录 5 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 5 篇

2602.16977 2026-02-20 cs.LG cs.CR 85%

Fail-Closed Alignment for Large Language Models

大型语言模型的Fail-Closed对齐

Zachary Coalson, Beth Sohler, Aiden Gabriel, Sanghyun Hong

机构 * Oregon State University, Corvallis, OR USA(俄勒冈州立大学)

专题命中 安全训练 :alignment(title,abstract);safety(abstract);jailbreak(abstract);分类 cs.LG

AI总结 本文提出fail-closed对齐原则,通过冗余独立路径提升LLM安全,有效对抗基于提示的Jailbreak攻击。

Comments Pre-print

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17345 2026-02-20 cs.CR cs.AI 57%

What Breaks Embodied AI Security:LLM Vulnerabilities, CPS Flaws,or Something Else?

使具身AI安全破裂的因素:大语言模型漏洞、CPS缺陷还是其他东西?

Boyang Ma, Hechuan Guo, Peizhuo Lv, Minghui Xu, Xuelong Dai, YeChao Zhang, Yijun Yang, Yue Zhang

机构 * Shandong University(山东大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本文探讨了具身AI安全问题的根源,指出系统级不匹配而非孤立模型缺陷或传统CPS攻击是主要因素,并提出了四个核心见解以解释其安全挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00167 2026-02-20 cs.AI cs.CR cs.RO 57%

Drones that Think on their Feet: Sudden Landing Decisions with Embodied AI

能自主决策的无人机:基于具身AI的突发着陆决策

Diego Ortiz Barbosa, Mohit Agrawal, Yash Malegaonkar, Luis Burbano, Axel Andersson, György Dán, Henrik Sandberg, Alvaro A. Cardenas

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本研究利用具身AI实现无人机在突发情况下的自主决策与安全着陆,展示了新的适应性恢复管道,提升了自主空中系统的安全性和韧性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17415 2026-02-20 cs.RO cs.SY eess.SY 50%

Distributed Virtual Model Control for Scalable Human-Robot Collaboration in Shared Workspace

分布式虚拟模型控制用于可扩展的人机协作在共享工作空间

Yi Zhang, Omar Faris, Chapa Sirithunge, Kai-Fung Chu, Fumiya Iida, Fulvio Forni

机构 * Department of Engineering, University of Cambridge(工程系,剑桥大学)

专题命中 安全训练 :safety(abstract)

AI总结 本文提出一种分布式虚拟模型控制框架,通过去中心化方法实现安全的人机协作,有效解决死锁问题并提升协作效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17078 2026-02-20 cs.MA 50%

Safe Continuous-time Multi-Agent Reinforcement Learning via Epigraph Form

通过epigraph形式实现安全的连续时间多智能体强化学习

Xuefeng Wang, Lei Zhang, Henglin Pu, Husheng Li, Ahmed H. Qureshi

专题命中 安全训练 :safety(abstract)

AI总结 本文提出了一种基于epigraph形式的连续时间约束MDP框架,通过物理信息神经网络实现稳定高效的连续时间多智能体强化学习,验证了方法在安全环境中的有效性。

Comments Accepted by ICLR 2026. 27 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏