Embedded Safety-Aligned Intelligence via Differentiable Internal Alignment Embeddings
通过可微内部对齐嵌入实现嵌入式安全对齐智能
机构 * Sardar Vallabhbhai National Institute of Technology (SVNIT)(萨达尔·瓦拉布尔·尼尔达理工学院)
专题命中 AI治理与伦理 :alignment(title,abstract);safety(title,abstract);分类 cs.AI、cs.LG
AI总结 本文提出嵌入式安全对齐智能框架,通过可微内部对齐嵌入实现多智能体强化学习中的安全对齐,探讨了反事实对齐惩罚、感知注意力等机制及理论性质。
Comments 32 pages, 1 figure. Theoretical framework; no empirical results