Training-Time Explainability for Multilingual Hate Speech Detection: Aligning Model Reasoning with Human Rationales
多语言仇恨言论检测的训练时可解释性:对齐模型推理与人类理由
机构 * Technological University Dublin(都柏林理工大学) ; National University of Sciences and Technology(国家科技大学) ; Maynooth University(梅努斯大学)
AI总结 该研究针对多语言仇恨言论检测的不透明问题,提出训练时可解释性框架,对齐模型推理与人类理由,经HateXplain、BullySent数据集及多方法评估,可提升分类性能与解释质量,助力多语言文化敏感的内容审核。
Comments Accepted at NeurIPS Workshops 2025