arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-02-02 至 2026-02-02 共收录 6 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. AI治理与伦理 6 篇

2512.11391 2026-02-02 cs.LG 88%

Mitigating the Safety Alignment Tax with Null-Space Constrained Policy Optimization

通过空域约束策略优化缓解安全对齐税

Yifan Niu, Han Xiao, Dongyi Liu, Nuo Chen, Jia Li

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 AI治理与伦理 :alignment(title,abstract);safety(title,abstract);分类 cs.LG

AI总结 通过空域约束策略优化缓解安全对齐税,提出NSPO框架在保留LLM核心能力的同时提升安全性能。

Comments accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22486 2026-02-02 cs.CY cs.AI 81%

AI Literacy, Safety Awareness, and STEM Career Aspirations of Australian Secondary Students: Evaluating the Impact of Workshop Interventions

澳大利亚中学生AI素养、安全意识与STEM职业抱负:评估工作坊干预的影响

Christian Bergh, Alexandra Vassar, Natasha Banks, Jessica Xu, Jake Renzella

机构 * University of New South Wales, Sydney(新南威尔士大学悉尼分校)

专题命中 AI治理与伦理 :safety(title,abstract);分类 cs.AI、cs.CY

AI总结 本研究评估了工作坊干预对澳大利亚中学生AI素养、安全意识和STEM职业兴趣的影响,发现干预提升了学生对AI的认知和兴趣,但需持续干预以影响长期职业抱负。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22621 2026-02-02 cs.CY 70%

Ethical Risks of Large Language Models in Medical Consultation: An Assessment Based on Reproductive Ethics

大语言模型在医疗咨询中的伦理风险:基于生殖伦理的评估

Hanhui Xu, Jiacheng Ji, Haoan Jin, Han Ying, Mengyue Wu

专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);分类 cs.CY

AI总结 本研究评估了大语言模型在生殖伦理咨询中的伦理风险,发现其在安全性和同理心方面存在严重缺陷,需加强推理和伦理依据能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25471 2026-02-02 cs.AI cs.CY 62%

An Aristotelian ontology of instrumental goals: Structural features to be managed and not failures to be eliminated

一种亚里士多德式的工具性目标本体论:需管理而非消除的结构特征

Willem Fourie

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.CY

AI总结 本文提出一种亚里士多德式的工具性目标本体论,将工具性目标视为高级AI系统需管理的特征,而非需消除的异常。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22745 2026-02-02 cs.LG 57%

Is Softmax Loss All You Need? A Principled Analysis of Softmax-family Loss

Softmax损失是否足够?对Softmax家族损失的系统分析

Yuanhao Pu, Defu Lian, Enhong Chen

机构 * School of Artificial Intelligence \& Data Science, University of Science \& Technology of China, Hefei, China School of Computer Science \& Technology, University of Science \& Technology of China, Hefei, China State Key Laboratory of Cognitive Intelligence, China

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.LG

AI总结 本文系统分析了Softmax家族损失的理论性质和实践效果,揭示了不同替代物在分类和排序中的一致性及收敛行为,提出了偏差-方差分解和复杂度分析,为大规模类别学习中的损失选择提供了理论基础和实践指导。

Comments 34 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12767 2026-02-02 cs.AI 57%

Language Models That Walk the Talk: A Framework for Formal Fairness Certificates

语言模型言出必行:一个形式公平证书的框架

Danqing Chen, Tobias Ladner, Ahmed Rayen Mhadhbi, Matthias Althoff

机构 * Technical University of Munich, Germany(慕尼黑技术大学)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI

AI总结 本文提出一个框架,用于验证大语言模型的鲁棒性和公平性,特别是在性别公平和毒性检测中的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏