Detoxifying Large Language Models via Autoregressive Reward Guided Representation Editing
机构 * SKLCCSE, Beihang University(北航智能计算与复杂系统研究院) ; National University of Singapore(新加坡国立大学) ; Zhongguancun Laboratory, Beijing(中关村实验室) ; Institute of Dataspace, Hefei(合肥数据空间研究院) ; Nanyang Technological University(南洋理工大学)
专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL
Comments Accepted to NeurIPS 25