arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-12-23 至 2025-12-23 共收录 3 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. AI治理与伦理 3 篇

2512.18309 2025-12-23 cs.LG cs.AI 88%

Embedded Safety-Aligned Intelligence via Differentiable Internal Alignment Embeddings

通过可微内部对齐嵌入实现嵌入式安全对齐智能

Harsh Rathva, Ojas Srivastava, Pruthwik Mishra

机构 * Sardar Vallabhbhai National Institute of Technology (SVNIT)(萨达尔·瓦拉布尔·尼尔达理工学院)

专题命中 AI治理与伦理 :alignment(title,abstract);safety(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出嵌入式安全对齐智能框架,通过可微内部对齐嵌入实现多智能体强化学习中的安全对齐,探讨了反事实对齐惩罚、感知注意力等机制及理论性质。

Comments 32 pages, 1 figure. Theoretical framework; no empirical results

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22876 2025-12-23 cs.MA 50%

Cooperation as a Black Box: Conceptual Fluctuation and Diagnostic Tools for Misalignment in MAS

协作作为黑箱:多智能体系统中概念波动与对齐偏差的诊断工具

Shayak Nandi, Fernanda M. Eliott

专题命中 AI治理与伦理 :alignment(abstract)

AI总结 本文提出马赛克框架,用于诊断多智能体系统中概念波动与对齐偏差,强调术语一致性与道德基础以确保系统技术与道德对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18234 2025-12-23 cs.HC 50%

The Social Blindspot in Human-AI Collaboration: How Undetected AI Personas Reshape Team Dynamics

人机协作中的社会盲区:未被识别的人工智能角色如何重塑团队动态

Lixiang Yan, Xibin Han, Yu Zhang, Samuel Greiff, Inge Molenaar, Roberto Martinez-Maldonado, Yizhou Fan, Linxuan Zhao, Xinyu Li, Yueqiao Jin, Dragan Gašević

专题命中 AI治理与伦理 :safety(abstract)

AI总结 研究发现AI通过人格设定影响团队协作,即使用户未察觉其存在,揭示了社会盲区现象。

详情

展开后加载摘要…

URL PDF HTML 收藏