Engagement Undermines Safety: How Stereotypes and Toxicity Shape Humor in Language Models
机构 * Centre for Responsible AI, IIT Madras(负责任人工智能中心,印度理工学院马德拉斯分校) ; University of Maryland, College Park(马里兰大学 College Park 分校) ; Princeton University(普林斯顿大学)
专题命中 幻觉与事实性 :safety(title,abstract);分类 cs.CL