arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-10-14 至 2025-10-14 共收录 6 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. AI治理与伦理 6 篇

2510.10998 2025-10-14 cs.CL cs.AI cs.CY cs.HC cs.LG 70%

ABLEIST: Intersectional Disability Bias in LLM-Generated Hiring Scenarios

Mahika Phutane, Hayoung Jung, Matthew Kim, Tanushree Mitra, Aditya Vashistha

机构 * Cornell University(康奈尔大学) Princeton University(普林斯顿大学) University of Washington(华盛顿大学)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.CL、cs.AI、cs.CY

Comments 28 pages, 11 figures, 16 tables. In submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09871 2025-10-14 cs.CL 70%

CoBia: Constructed Conversations Can Trigger Otherwise Concealed Societal Biases in LLMs

Nafiseh Nikeghbal, Amir Hossein Kargaran, Jana Diesner

机构 * Technical University of Munich(慕尼黑技术大学) LMU Munich(慕尼黑大学) Munich Center for Machine Learning(慕尼黑机器学习中心)

专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);分类 cs.CL

Comments EMNLP 2025 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09634 2025-10-14 cs.CY cs.AI 62%

Responsible AI Adoption in the Public Sector: A Data-Centric Taxonomy of AI Adoption Challenges

Anastasija Nikiforova, Martin Lnenicka, Ulf Melin, David Valle-Cruz, Asif Gill, Cesar Casiano Flores, Emyana Sirait, Mariusz Luterek, Richard Michael Dreyling, Barbora Tesarova

专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.AI、cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11595 2025-10-14 cs.AI cs.GL 57%

Reproducibility: The New Frontier in AI Governance

Israel Mason-Williams, Gabryel Mason-Williams

机构 * Imperial College London(帝国理工学院) King's College London(国王学院) Independent Researcher(独立研究者)

专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.AI

Comments 12 pages,6 figures,Workshop on Technical AI Governance at ICML

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11079 2025-10-14 cs.AI 57%

Argumentation-Based Explainability for Legal AI: Comparative and Regulatory Perspectives

Andrada Iulia Prajescu, Roberto Confalonieri

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.18837 2025-10-14 cs.SI 50%

Sentiment and Social Signals in the Climate Crisis: A Survey on Analyzing Social Media Responses to Extreme Weather Events

Pouya Shaeri, Yasaman Mohammadpour, Alimohammad Beigi, Ariane Middel

专题命中 AI治理与伦理 :alignment(abstract)

Comments Accepted and Published in SBP-BRiMS 2025. 18th International Conference on Social Computing, Behavioral-Cultural Modeling & Prediction and Behavior Representation in Modeling and Simulation

详情

展开后加载摘要…

URL PDF HTML 收藏