arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-11-21 至 2025-11-21 共收录 4 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. AI治理与伦理 4 篇

2509.08592 2025-11-21 cs.LG cs.AI cs.ET 81%

Interpretability as Alignment: Making Internal Understanding a Design Principle

可解释性作为对齐:使内部理解成为设计原则

Aadit Sengupta, Pratinav Seth, Vinay Kumar Sankarapu

机构 * Lexsi Labs(Lexsi实验室)

专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出将可解释性作为设计原则,通过机理可解释性构建私营AI治理的基础设施,实现技术可靠性与制度问责的结合。

Comments Accepted at the first EurIPS Workshop on Private AI Governance

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21456 2025-11-21 cs.CL 79%

Diagnosing the Performance Trade-off in Moral Alignment: A Case Study on Gender Stereotypes

在道德一致性中的性能权衡诊断:关于性别刻板印象的案例研究

Guangliang Liu, Bocheng Chen, Han Zi, Xitong Zhang, Kristen Marie Johnson

机构 * Michigan State University(密歇根州立大学) University of Mississippi(密苏里大学) Northeastern University(东北大学)

专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.CL

AI总结 本文通过分析性别刻板印象缓解中的性能权衡,发现当前公平性目标存在局限,整体遗忘与下游任务性能密切相关,选择性遗忘无法有效降低整体遗忘。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04695 2025-11-21 cs.AI cs.CE cs.ET cs.LG 62%

Bridging the Gap in XAI-Why Reliable Metrics Matter for Explainability and Compliance

弥合XAI差距:可靠度量在可解释性与合规性中的重要性

Pratinav Seth, Vinay Kumar Sankarapu

机构 * Lexsi Labs(Lexsi实验室)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出以度量治理的范式,通过标准化指标提升AI系统的可解释性和合规性,防止对齐造假,构建持续的AI保证流程。

Comments Accepted at first EurIPS Workshop on Private AI Governance

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15859 2025-11-21 cs.SE 50%

RE for AI in Practice: Managing Data Annotation Requirements for AI Autonomous Driving Systems

在实践中为AI管理数据标注需求:为AI自主驾驶系统管理数据标注要求

Hina Saeeda, Mazen Mohamad, Eric Knauss, Jennifer Horkoff, Ali Nouri

专题命中 AI治理与伦理 :safety(abstract)

AI总结 本研究通过实证分析,探讨了自动驾驶系统中数据标注需求的定义、挑战及最佳实践,为提升AI系统可靠性提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏