arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-09-30 至 2025-09-30 共收录 3 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. AI治理与伦理 3 篇

2406.09264 2025-09-30 cs.HC cs.AI cs.CL 81%

Position: Towards Bidirectional Human-AI Alignment

Hua Shen, Tiffany Knearem, Reshmi Ghosh, Kenan Alkiek, Kundan Krishna, Yachuan Liu, Ziqiao Ma, Savvas Petridis, Yi-Hao Peng, Li Qiwei, Sushrita Rakshit, Chenglei Si, Yutong Xie, Jeffrey P. Bigham, Frank Bentley, Joyce Chai, Zachary Lipton, Qiaozhu Mei, Rada Mihalcea, Michael Terry, Diyi Yang, Meredith Ringel Morris, Paul Resnick, David Jurgens

机构 * NYU Shanghai, New York University(纽约大学上海研究院,纽约大学) MBZUAI(穆桑大学人工智能研究所) Microsoft(微软公司) University of Michigan(密歇根大学) Apple(苹果公司) Google(谷歌公司) Carnegie Mellon University(卡内基梅隆大学) Stanford University(斯坦福大学) Google DeepMind(谷歌DeepMind)

专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.CL、cs.AI

Comments NeurIPS 2025 Position Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22709 2025-09-30 cs.CY cs.SY eess.SY 70%

Trust and Transparency in AI: Industry Voices on Data, Ethics, and Compliance

Louise McCormack, Diletta Huyskes, Dave Lewis, Malika Bendechache

专题命中 AI治理与伦理 :safety(abstract);trustworthy(abstract);分类 cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13758 2025-09-30 cs.CY 57%

Towards Evaluting Fake Reasoning Bias in Language Models

Qian Wang, Zhenheng Tang, Zhanzhi Lou, Nuo Chen, Wenxuan Wang, Bingsheng He

专题命中 AI治理与伦理 :DPO(abstract);分类 cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏