arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-10-22 至 2025-10-22 共收录 3 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 幻觉与事实性 3 篇

2510.18454 2025-10-22 cs.CL 79%

Engagement Undermines Safety: How Stereotypes and Toxicity Shape Humor in Language Models

Atharvan Dogra, Soumya Suvra Ghosal, Ameet Deshpande, Ashwin Kalyan, Dinesh Manocha

机构 * Centre for Responsible AI, IIT Madras(负责任人工智能中心,印度理工学院马德拉斯分校) University of Maryland, College Park(马里兰大学 College Park 分校) Princeton University(普林斯顿大学)

专题命中 幻觉与事实性 :safety(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14008 2025-10-22 cs.MA 78%

Stop Reducing Responsibility in LLM-Powered Multi-Agent Systems to Local Alignment

Jinwei Hu, Yi Dong, Shuang Ao, Zhuoyun Li, Boxuan Wang, Lokesh Singh, Guangliang Cheng, Sarvapali D. Ramchurn, Xiaowei Huang

专题命中 幻觉与事实性 :alignment(title,abstract)

Comments Updated manuscript of our previous version (arXiv:2502.01714). Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21657 2025-10-22 cs.CL cs.AI cs.LG 67%

Explaining Large Language Models with gSMILE

Zeinab Dehghani, Mohammed Naveed Akram, Koorosh Aslansefat, Adil Khan, Yiannis Papadopoulos

机构 * University of Hull(赫尔大学) Fraunhofer IESE(弗劳恩霍夫研究所)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏