arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-03-05 至 2026-03-05 共收录 3 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. AI治理与伦理 3 篇

2603.03515 2026-03-05 cs.CY cs.AI 62%

The Controllability Trap: A Governance Framework for Military AI Agents

可控性陷阱:军事AI代理的治理框架

Subramanyam Sahoo

机构 * MARS (Mentorship for Alignment Researchers) 4.0 Fellow(MARS(对齐研究导师计划)4.0 Fellow) Cambridge AI Safety Hub (CAISH) University of Cambridge(剑桥AI安全中心(CAISH)剑桥大学)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI、cs.CY

AI总结 本文提出AMAGF框架,通过预防、检测和纠正三个支柱,解决军事AI代理中的控制失效问题,通过控制质量评分实现持续控制管理。

Comments Accepted at ICLR 2026 Workshop on Agents in the Wild. 20 Pages and 3 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03341 2026-03-05 cs.CY cs.AI 62%

Ethical and Explainable AI in Reusable MLOps Pipelines

可重用MLOps流水线中的伦理与可解释性AI

Rakib Hossain, Mahmood Menon Khan, Lisan Al Amin, Dhruv Parikh, Farhana Afroz, Bestoun S. Ahmed

机构 * Washington University of Science and Technology(科学与技术华盛顿大学) University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校) Karlstad University(卡尔斯塔德大学) American University of Bahrain(巴林美国大学)

专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.AI、cs.CY

AI总结 本文提出了一种整合伦理和可解释性AI的MLOps框架,通过自动化公平性控制和可解释性特征,在生产环境中实现公平性与预测效用的平衡。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21648 2026-03-05 cs.AI 57%

Leveraging Imperfection with MEDLEY A Multi-Model Approach Harnessing Bias in Medical AI

利用不完美性:MEDLEY:一种多模型方法,利用医学AI中的偏差

Farhad Abtahi, Mehdi Astaraki, Fernando Seoane

专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.AI

AI总结 MEDLEY提出了一种多模型框架,通过保留模型多样性而非压缩共识,利用医学AI中的偏差提升诊断准确性与透明度。

Journal ref Front. Artif. Intell., Volume 9 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏