AI Safety, Alignment, and Ethics (AI SAE)
专题命中 AI治理与伦理 :alignment(title,abstract);safety(title);AI safety(title);分类 cs.CY
Comments 46 pages, 9 figures (including appendix), 1 table
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
专题命中 AI治理与伦理 :alignment(title,abstract);safety(title);AI safety(title);分类 cs.CY
Comments 46 pages, 9 figures (including appendix), 1 table
专题命中 AI治理与伦理 :safety(title,abstract);分类 cs.CL
Comments Preprint of a paper accepted as a poster at the NeurIPS 2025 Workshop on Generative AI for Health (GenAI4Health). The final camera-ready workshop version may differ. Licensed under CC BY 4.0
机构 * University of Calabria(卡利博利亚大学)
专题命中 AI治理与伦理 :safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI
Journal ref Cantini, R., Orsino, A., Ruggiero, M., Talia, D. Benchmarking adversarial robustness to bias elicitation in large language models: scalable automated assessment with LLM-as-a-judge. Mach Learn 114, 249 (2025)
机构 * Frontier AI Labs(前沿人工智能实验室)
专题命中 AI治理与伦理 :safety(abstract);AI safety(abstract);分类 cs.AI
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI
机构 * Technische Universität Dresden(德累斯顿技术大学) ; Center for Scalable Data Analytics and Artificial Intelligence (ScaDS.AI)(可扩展数据与人工智能研究中心(ScaDS.AI))
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.LG
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI
Comments 40 pages, 14 figures, 9 Tables
机构 * Queen’s University and Vector Institute(女王大学和向量研究所) ; University of Tokyo(东京大学) ; University of Toronto(多伦多大学)
专题命中 AI治理与伦理 :safety(abstract);分类 cs.LG
Comments 43 pages, 11 figures, 14 tables
机构 * Vector Institute(向量研究所) ; Independent Researcher(独立研究者)
专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.AI
Comments we quarterly update of this literature