arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-09-09 至 2025-09-09 共收录 3 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. AI治理与伦理 3 篇

2410.22591 2025-09-09 cs.LG cs.AI stat.ME 62%

FACEGroup: Feasible and Actionable Counterfactual Explanations for Group Fairness

Christos Fragkathoulas, Vasiliki Papanikou, Evaggelia Pitoura, Evimaria Terzi

机构 * University of Ioannina(伊奥安纳大学) Archimedes, Athena Research Center(阿基米德研究所) Boston University(波士顿大学)

专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.AI、cs.LG

Comments ECML PKDD 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05627 2025-09-09 cs.CY cs.LG stat.ML 62%

Audits Under Resource, Data, and Access Constraints: Scaling Laws For Less Discriminatory Alternatives

Sarah H. Cen, Salil Goyal, Zaynah Javed, Ananya Karthik, Percy Liang, Daniel E. Ho

机构 * Stanford University(斯坦福大学)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.CY、cs.LG

Comments 34 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06700 2025-09-09 cs.NI 50%

Sovereign AI for 6G: Towards the Future of AI-Native Networks

Swarna Bindu Chetty, David Grace, Simon Saunders, Paul Harris, Eirini Eleni Tsiropoulou, Tony Quek, Hamed Ahmadi

专题命中 AI治理与伦理 :safety(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏