ToxiGAN: Toxic Data Augmentation via LLM-Guided Directional Adversarial Generation
ToxiGAN: 通过LLM引导的定向对抗生成进行有毒数据增强
机构 * Freie Universität Berlin(弗里德里希-莱布尼茨柏林大学) ; Fraunhofer-Institut für Offene Kommunikationssysteme(弗劳恩霍夫开放通信系统研究所) ; Institut für Angewandte Informatik(应用信息研究所) ; Stanford University(斯坦福大学)
专题命中 其他LLM :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 ToxiGAN通过LLM引导的定向对抗生成方法,提升有毒数据增强的可控性和类别特定性,有效增强分类器鲁棒性。
Comments This paper has been accepted to the main conference of EACL 2026