arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-08-04 至 2025-08-04 共收录 4 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 4 篇

2508.00673 2025-08-04 cs.CL 74%

MELAC: Massive Evaluation of Large Language Models with Alignment of Culture in Persian Language

Farhan Farsi, Farnaz Aghababaloo, Shahriar Shariati Motlagh, Parsa Ghofrani, MohammadAli SadraeiJavaheri, Shayan Bali, Amirhossein Shabani, Farbod Bijary, Ghazal Zamaninejad, AmirMohammad Salehoof, Saeedeh Momtazi

机构 * Amirkabir University of Technology(阿姆irkabir技术大学) Part AI Research Center(Part人工智能研究中心) University of Mazandaran(马赞德兰大学) King’s College London(伦敦国王学院)

专题命中 安全评测 :alignment(title);分类 cs.CL

Comments Preprint. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00081 2025-08-04 cs.AI 57%

Rethinking Evidence Hierarchies in Medical Language Benchmarks: A Critical Evaluation of HealthBench

Fred Mutisya, Shikoh Gitau, Nasubo Ongoma, Keith Mbae, Elizabeth Wamicha

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18004 2025-08-04 cs.AI 57%

E.A.R.T.H.: Structuring Creative Evolution through Model Error in Generative AI

Yusen Peng, Shuhua Mao

机构 * University of Warwick(沃里克大学) Wuhan University of Technology(武汉理工大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

Comments 44 pages,11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17130 2025-08-04 cs.AI 57%

Chain-of-Trust: A Progressive Trust Evaluation Framework Enabled by Generative AI

Botao Zhu, Xianbin Wang, Lei Zhang, Xuemin, Shen

机构 * Department of Electrical and Computer Engineering, Western University(西方大学电气与计算机工程系) James Watt School of Engineering, University of Glasgow(格拉斯哥大学詹姆斯·瓦特工程学院) Department of Electrical and Computer Engineering, University of Waterloo(滑铁卢大学电气与计算机工程系)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

Journal ref IEEE Network, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏