New Terms, New Toxicity: Consensus-based Chinese Neologism Toxicity Detection via Search-Augmented LLMs
新术语,新毒性:基于共识的新词毒性检测——通过搜索增强型大语言模型(LLMs)
机构 * Tsinghua University(清华大学) ; ICT, CAS(中国科学院计算技术研究所) ; National Computer Network Emergency Response Technical Team Coordination Center of China(国家计算机网络应急技术处理协调中心) ; IIE, CAS(中国科学院工程热物理研究所) ; School of Cyber Security, UCAS(中国科学院大学网络空间安全学院) ; JCSS, Tsinghua University(清华大学软件学院) ; Science City (Guangzhou) Digital Technology Group Co., Ltd.(广州科学城数字科技集团有限公司)
AI总结 本文针对毒性新词的检测问题,提出捕捉毒性新词起源与共识标准的分类法,构建风险词表,引入搜索增强型框架SeTox,实验显示3B规模的SeTox性能优于近期大规模模型。
Comments ACL 2026