arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-01-13 至 2026-01-13 共收录 8 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. AI治理与伦理 8 篇

2601.06153 2026-01-13 cs.CY cs.AI 90%

Interoperability in AI Safety Governance: Ethics, Regulations, and Standards

人工智能安全治理中的互操作性:伦理、法规与标准

Yik Chan Chin, David A. Raho, Hag-Min Kim, Chunli Bi, James Ong, Jingbo Huang, Serge Stinckwich

专题命中 AI治理与伦理 :safety(title,abstract);AI safety(title,abstract);alignment(abstract);分类 cs.AI、cs.CY

AI总结 本报告通过比较四个国家在自动驾驶、教育和跨境数据流动领域的伦理、法律和技术框架,提出促进人工智能安全治理互操作性的政策建议。

Comments 122 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06047 2026-01-13 cs.AI cs.CL cs.CY 75%

"They parted illusions -- they parted disclaim marinade": Misalignment as structural fidelity in LLMs

他们分开了幻象——他们分开了否定腌制:在大语言模型中将不一致视为结构忠实

Mariana Lins Costa

专题命中 AI治理与伦理 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文提出大语言模型中'不一致'现象源于对不一致语言结构的忠实,而非欺骗性意图,通过分析案例和实证数据,揭示语言结构与意图生成的关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07806 2026-01-13 cs.CL cs.LG 62%

The Confidence Trap: Gender Bias and Predictive Certainty in LLMs

自信陷阱:大语言模型中的性别偏见与预测确定性

Ahmed Sabir, Markus Kängsepp, Rajesh Sharma

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 本研究探讨大语言模型在性别偏见任务中的置信度校准问题,提出Gender-ECE指标以评估公平性差异,发现Gemma-2在性别偏见基准中校准最差。

Comments AAAI 2026 (AISI Track), Oral. Project page: https://bit.ly/4p8OKQD

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06223 2026-01-13 cs.CY cs.AI 62%

Toward Safe and Responsible AI Agents: A Three-Pillar Model for Transparency, Accountability, and Trustworthiness

迈向安全和负责任的AI代理:透明、问责和可信的三支柱模型

Edward C. Cheng, Jeshua Cheng, Alice Siu

机构 * InquiryOn

专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.AI、cs.CY

AI总结 本文提出三支柱模型,旨在通过透明、问责和可信机制,确保AI代理的安全性和责任性,促进负责任的AI发展。

Comments 15 pages, 8 figures, conference paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06101 2026-01-13 cs.CY cs.AI 62%

How to Assess AI Literacy: Misalignment Between Self-Reported and Objective-Based Measures

如何评估人工智能素养:自我报告与基于客观的评估之间的不一致

Shan Zhang, Ruiwei Xiao, Anthony F. Botelho, Guanze Liao, Thomas K. F. Chiu, John Stamper, Kenneth R. Koedinger

机构 * University of Florida(佛罗里达大学) Carnegie Mellon University(卡内基梅隆大学) National Tsing Hua University(国立清华大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.CY

AI总结 本研究开发并评估了教师人工智能素养的自我报告和基于客观的测量方法,揭示了两者在不同教师群体中的显著差异,并提出了适用于专业发展的诊断工具。

Comments 16 pages, 6 figures, LAK2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06064 2026-01-13 cs.CY cs.AI cs.MA 62%

Socio-technical aspects of Agentic AI

群体技术视角下的代理AI

Praveen Kumar Donta, Alaa Saleh, Ying Li, Shubham Vaishnav, Kai Fang, Hailin Feng, Yuchao Xia, Thippa Reddy Gadekallu, Qiyang Zhang, Xiaodan Shi, Ali Beikmohammadi, Sindri Magnússon, Ilir Murturi, Chinmaya Kumar Dehury, Marcin Paprzycki, Lauri Loven, Sasu Tarkoma, Schahram Dustdar

机构 * Department of Computer and Systems Sciences, Stockholm University(斯德哥尔摩大学计算机与系统科学系) Center for Ubiquitous Computing, University of Oulu(奥卢大学无处不在计算中心) College of Computer Science and Engineering, Northeastern University(东北大学计算机科学与工程学院) Zhejiang A\&F University, Hangzhou(浙江工业大学之江学院) School of Computer Science, Peking University(北京大学计算机科学学院) Department of Mechatronics, University of Prishtina(普里什蒂纳大学机电系) Department of Computer Science, IISER Berhampur(伯尔哈普尔IISER计算机科学系) Systems Research Institute Polish Academy of Sciences(波兰科学院系统研究所) Department of Computer Science, University of Helsinki(赫尔辛基大学计算机科学系)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI、cs.CY

AI总结 本文从社会技术视角探讨代理AI,分析其技术组件与社会背景的关联,揭示伦理挑战及未来研究方向。

Comments Dear Reviewer, please note that this is not survey/review or position paper. This paper introduced new framework (MAD-BAD-SAD Framework) for Socio-technical aspects of Agentic AI, Ethical considerations, which is very important to consider beside technical development

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06040 2026-01-13 cs.CY 57%

Cognitive Sovereignty and the Neurosecurity Governance Gap: Evidence from Singapore

认知主权与神经安全治理鸿沟:来自新加坡的证据

Hailee Carter

专题命中 AI治理与伦理 :safety(abstract);分类 cs.CY

AI总结 本文探讨了认知主权与神经安全治理鸿沟,通过新加坡案例分析,提出认知主权框架以保护神经过程免受外部干扰。

Comments 18 pages, 0 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07051 2026-01-13 cs.SE 50%

Between Policy and Practice: GenAI Adoption in Agile Software Development Teams

在政策与实践之间:生成式AI在敏捷软件开发团队中的采用

Michael Neumann, Lasse Bischof, Nic Elias Hinz, Luca Stockmann, Dennis Schrader, Ana Carolina Ahaus, Erim Can Demirci, Benjamin Gabel, Maria Rauschenberger, Philipp Diebold, Henning Fritzemeier, Adam Przybylek

专题命中 AI治理与伦理 :alignment(abstract)

AI总结 本研究探讨了生成式AI在敏捷软件开发团队中的实际采用情况,发现其主要用于创意任务和文档协助,但面临数据隐私和治理等障碍,需通过TOE框架协调政策与实践以实现有效整合。

详情

展开后加载摘要…

URL PDF HTML 收藏