arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-08-07 至 2025-08-07 共收录 4 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. AI治理与伦理 4 篇

2508.03970 2025-08-07 cs.CL cs.AI 62%

Data and AI governance: Promoting equity, ethics, and fairness in large language models

Alok Abhishek, Lisa Erickson, Tushar Bandopadhyay

机构 * Independent Researcher(独立研究者)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.CL、cs.AI

Comments Published in MIT Science Policy Review 6, 139-146 (2025)

Journal ref MIT Science Policy Review, 6. (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04071 2025-08-07 cs.LG 57%

Adversarial Fair Multi-View Clustering

Mudi Jiang, Jiahui Zhou, Lianyu Hu, Xinying Liu, Zengyou He, Zhikui Chen

机构 * School of Software, Dalian University of Technology(大连理工大学软件学院)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17945 2025-08-07 cs.CL 57%

Assessing Agentic Large Language Models in Multilingual National Bias

Qianying Liu, Katrina Qiyao Wang, Fei Cheng, Sadao Kurohashi

机构 * National Institute of Informatics, Japan(日本信息机构国家研究所) University of Wisconsin—Madison, USA(美国威斯康星大学麦迪逊分校) Kyoto University, Japan(日本京都大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL

Comments Accepted to ACL 2025 Findings. 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.10945 2025-08-07 cs.LG stat.ML 57%

Gradient-Based Multi-Objective Deep Learning: Algorithms, Theories, Applications, and Beyond

Weiyu Chen, Baijiong Lin, Xiaoyuan Zhang, Xi Lin, Han Zhao, Qingfu Zhang, James T. Kwok

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) City University of Hong Kong(香港城市大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏