arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-01-08 至 2026-01-08 共收录 3 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. AI治理与伦理 3 篇

2601.03578 2026-01-08 cs.CL 70%

PsychEthicsBench: Evaluating Large Language Models Against Australian Mental Health Ethics

PsychEthicsBench: 评估大型语言模型在澳大利亚心理健康伦理中的表现

Yaling Shen, Stephanie Fong, Yiwen Jiang, Zimu Wang, Feilong Tang, Qingyang Xu, Xiangyu Zhao, Zhongxing Xu, Jiahe Liu, Jinpeng Hu, Dominic Dwyer, Zongyuan Ge

机构 * Monash University(墨尔本大学) University of Liverpool(利物浦大学) Hefei University of Technology(合肥工业大学)

专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);分类 cs.CL

AI总结 PsychEthicsBench通过多选和开放式任务评估LLMs在心理健康伦理方面的表现,揭示拒绝率作为伦理指标的不足,并指出领域微调可能损害伦理鲁棒性。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04747 2026-01-08 cs.CY cs.AI 62%

E-LENS: User Requirements-Oriented AI Ethics Assurance

E-LENS:以用户需求为导向的AI伦理保证

Jianlong Zhou, Fang Chen

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI、cs.CY

AI总结 本文提出以用户需求为导向的AI伦理保证方法,通过E-LENS平台验证AI伦理,以航空安全方法为借鉴,结合危险分析构建AI伦理保证案例。

Comments 29 pages

Journal ref Human-Intelligent Systems Integration, August 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04107 2026-01-08 cs.CY 57%

From Abstract Threats to Institutional Realities: A Comparative Semantic Network Analysis of AI Securitisation in the US, EU, and China

从抽象威胁到制度现实:对美、欧、中三国人工智能安全化的比较语义网络分析

Ruiyi Guo, Bodong Zhang

专题命中 AI治理与伦理 :safety(abstract);分类 cs.CY

AI总结 本文通过比较语义网络分析,揭示美欧中三国在人工智能治理上的制度逻辑差异,指出结构性不可通约性导致治理协调困难。

Comments Submitted to the 2026 ACM Conference on Fairness, Accountability, and Transparency (ACM FAccT)

详情

展开后加载摘要…

URL PDF HTML 收藏